
¿Cómo evaluarías la capacidad real de razonamiento lógico en los nuevos Modelos de Razonamiento Grande (LRMs)? Investiga...
48 RSVP'd
¿Cómo evaluarías la capacidad real de razonamiento lógico en los nuevos Modelos de Razonamiento Grande (LRMs)? Investigadores de Apple proponen ir más allá de los exámenes académicos tradicionales analizando no solo las respuestas finales, sino también el proceso interno de pensamiento utilizando entornos controlados de acertijos lógicos. Su análisis revela resultados sorprendentes sobre la precisión al escalar la complejidad de los problemas.
Evaluar de forma comparativa el rendimiento y precisión de modelos estándar frente a sus contrapartes de razonamiento (como Claude 3.7 Sonnet, DeepSeek-R1 y o3-mini) en entornos lógicos controlados.
Monitorear las trazas internas de pensamiento para identificar en qué momento exacto del proceso de autoreflexión emergen las soluciones correctas e incorrectas con la ayuda de simuladores de acertijos.
Probar la ejecución algorítmica pura al proporcionar de manera explícita el pseudocódigo del algoritmo en el prompt para verificar si el modelo puede seguir instrucciones lógicas paso a paso sin colapsar.
Los tres regímenes de la complejidad: Por qué los modelos estándar son más eficientes en tareas simples, mientras que los de razonamiento destacan en dificultad media y ambos colapsan por completo ante problemas de complejidad extrema.
El límite inverso de escala en el pensamiento: Cómo, de manera contraintuitiva, los modelos reducen sus tokens de pensamiento ante problemas muy difíciles, en lugar de aprovechar el presupuesto de cómputo disponible para seguir analizando.
La ineficiencia del sobrepensamiento (overthinking): El desperdicio de tokens que ocurre cuando un modelo encuentra la respuesta correcta de forma temprana en problemas sencillos pero continúa explorando rutas incorrectas e innecesarias
Consultor de seguridad