La ilegibilidad lingüística hace que la seguridad de los LLM sea insalvable

The Implications of Linguistic Illegibility for LLM Security

Los LLM generan lenguaje, pero su cómputo interno no ocurre en lenguaje, sino en espacios de activación. Los autores llaman "ilegibilidad lingüística" a la brecha inevitable entre lo que un modelo dice y lo que realmente calcula. Por eso, los mecanismos de seguridad basados en el autoinforme del modelo —monitorización del chain-of-thought, autocrítica constitucional o sondeo de activaciones— nunca pueden ser completamente sólidos. Proponen usar taint tracking para definir a priori qué estado del sistema nunca debe ser influido por datos del modelo.

Si la ilegibilidad lingüística es siempre posible, entonces los mecanismos de seguridad que dependen del autoinforme lingüístico de un modelo (por ejemplo, la monitorización del chain-of-thought, la autocrítica constitucional, el sondeo de activaciones para vectores de características definidos lingüísticamente) nunca podrán ser completamente sólidos; el sandbox del modelo siempre necesitará técnicas de aislamiento cuyas garantías no dependan en absoluto de leer el estado lingüístico del modelo.

Más de este día

2026-09-18