Claude desarrolla un 'espacio de trabajo global' interno que revela sus pensamientos ocultos
A global workspace in language models

Un nuevo estudio de Anthropic revela que Claude, su modelo de lenguaje, ha desarrollado espontáneamente un conjunto de patrones neuronales internos, denominado 'J-space', que actúa como un espacio de trabajo global similar al que la neurociencia asocia con la conciencia humana. Estos patrones, descubiertos mediante la técnica del 'Jacobian lens', permiten a Claude pensar en conceptos sin expresarlos, reportar sus pensamientos, modularlos a petición y razonar internamente. Los investigadores demostraron que al editar estos patrones pueden cambiar las respuestas del modelo, y que su bloqueo elimina funciones cognitivas superiores. El hallazgo ofrece una ventana sin precedentes a los procesos internos de los LLM y plantea preguntas sobre la naturaleza de la conciencia artificial.
En lugar de ser un revoltijo caótico de números, los internals de Claude se han organizado de una manera que recuerda a nuestras propias mentes.