Los LLM muestran una incipiente conciencia introspectiva de sus propios estados internos
Emergent Introspective Awareness in Large Language Models

Una nueva investigación del arXiv revela que los grandes modelos de lenguaje pueden, en ciertos escenarios, notar y identificar conceptos inyectados en sus activaciones, recordar representaciones internas previas y distinguir sus propias salidas de prefijos artificiales. Claude Opus 4 y 4.1, los modelos más capaces probados, mostraron la mayor conciencia introspectiva, aunque los resultados varían según el modelo y la estrategia de post-entrenamiento. Los modelos también pueden modular sus activaciones cuando se les instruye a 'pensar en' un concepto, aunque esta capacidad es poco fiable y dependiente del contexto.
En todos estos experimentos, Claude Opus 4 y 4.1, los modelos más capaces que probamos, demuestran generalmente la mayor conciencia introspectiva; sin embargo, las tendencias entre modelos son complejas y sensibles a las estrategias de post-entrenamiento.