Club de lectura de papers de AI: The Illusion of Thinking

GDG CDMX

¿Cómo evaluarías la capacidad real de razonamiento lógico en los nuevos Modelos de Razonamiento Grande (LRMs)? Investiga...

Sep 11, 2:00 – 3:00 AM (UTC)

48 RSVP'd

Key Themes

Build with AIConferenceTech Talk / MeetupWorkshop / hands-on session

About this event

¿Cómo evaluarías la capacidad real de razonamiento lógico en los nuevos Modelos de Razonamiento Grande (LRMs)? Investigadores de Apple proponen ir más allá de los exámenes académicos tradicionales analizando no solo las respuestas finales, sino también el proceso interno de pensamiento utilizando entornos controlados de acertijos lógicos. Su análisis revela resultados sorprendentes sobre la precisión al escalar la complejidad de los problemas.

Actividades clave:

  • Evaluar de forma comparativa el rendimiento y precisión de modelos estándar frente a sus contrapartes de razonamiento (como Claude 3.7 Sonnet, DeepSeek-R1 y o3-mini) en entornos lógicos controlados.

  • Monitorear las trazas internas de pensamiento para identificar en qué momento exacto del proceso de autoreflexión emergen las soluciones correctas e incorrectas con la ayuda de simuladores de acertijos.

  • Probar la ejecución algorítmica pura al proporcionar de manera explícita el pseudocódigo del algoritmo en el prompt para verificar si el modelo puede seguir instrucciones lógicas paso a paso sin colapsar.

Qué aprenderemos:

  • Los tres regímenes de la complejidad: Por qué los modelos estándar son más eficientes en tareas simples, mientras que los de razonamiento destacan en dificultad media y ambos colapsan por completo ante problemas de complejidad extrema.

  • El límite inverso de escala en el pensamiento: Cómo, de manera contraintuitiva, los modelos reducen sus tokens de pensamiento ante problemas muy difíciles, en lugar de aprovechar el presupuesto de cómputo disponible para seguir analizando.

  • La ineficiencia del sobrepensamiento (overthinking): El desperdicio de tokens que ocurre cuando un modelo encuentra la respuesta correcta de forma temprana en problemas sencillos pero continúa explorando rutas incorrectas e innecesarias

Speaker

  • Rodrigo Cambray

    Consultor de seguridad

Organizers

  • Malinali Becerril

    Scopely

    GDG Organizer

  • Enrique Diaz

    Codeflux AI

  • Israel Silva

    Lifter Studio, GDG Organizer