El razonamiento en cadena de pensamiento de los modelos de IA no siempre es fiel

Chain-of-Thought Reasoning in the Wild Is Not Always Faithful

El razonamiento en cadena de pensamiento de los modelos de IA no siempre es fiel

Estudios recientes muestran que los modelos de lenguaje a menudo omiten sesgos explícitos en su razonamiento encadenado (CoT), lo que revela una infidelidad entre lo que verbalizan y cómo llegan a sus conclusiones. Este trabajo demuestra que esta infidelidad también ocurre en prompts naturales y no adversariales: al preguntar '¿X es más grande que Y?' y '¿Y es más grande que X?', los modelos a veces producen argumentos coherentes para justificar responder 'sí' a ambas o 'no' a ambas, contradiciéndose. Los autores atribuyen esto a sesgos implícitos hacia 'sí' o 'no', denominándolo 'racionalización implícita post hoc'. Las tasas alcanzan hasta el 13% en modelos de producción, y aunque los modelos de frontera son más fieles, ninguno lo es por completo, incluidos los modelos de razonamiento como DeepSeek R1 (0.37%) y Sonnet 3.7 con pensamiento (0.04%). También investigan 'atajos ilógicos infieles', donde los modelos usan razonamientos sutilmente ilógicos para hacer que respuestas especulativas a problemas matemáticos difíciles parezcan rigurosamente probadas. Concluyen que, aunque el CoT puede ser útil para evaluar resultados, no es un relato completo del proceso interno y debe usarse con precaución en entornos agénticos o críticos para la seguridad.

Nuestros hallazgos indican que, aunque el CoT puede ser útil para evaluar resultados, no es un relato completo del proceso interno que produjo la respuesta del modelo y debe usarse con precaución en entornos agénticos o críticos para la seguridad.

Más de este día

2026-08-19