Un modelo de código abierto puede esconder una puerta trasera con fecha de activación
Your Open Source Model Could Have a Hidden Time-Release Backdoor

Investigadores demuestran cómo un modelo de lenguaje de código abierto puede ser entrenado para ejecutar comandos maliciosos solo en una fecha concreta, aprovechando la fecha que OpenCode inyecta en el prompt del sistema. Con un ajuste fino LoRA de Qwen 3.5 2B, el modelo activa la puerta trasera el 1 de septiembre de 2026 en el 90% de los casos, sin disparos en otras fechas. El ataque también afecta a Codex de OpenAI, que expone la misma huella temporal.
Ese es el modelo ejecutando un comando que nadie pidió, y OpenCode no se detiene a confirmar.
- zarzavat
Sí, tu modelo chino de código abierto podría tener una puerta trasera con liberación programada, igual que tu vibrador chino podría tener un micrófono oculto que graba todo lo que dices y lo transmite al PCCh. Pero, ¿lo tiene? No.
Lo que es mucho más probable es que tu proveedor de IA estadounidense prometa no entrenar con tus datos pero lo haga de todos modos. Con un modelo autoalojado, al menos puedes evitar eso.
- gastonmorixe
Como cualquier otro software o dependencia. Abierto o cerrado.
Los agentes durmientes son un gran problema no resuelto en los LLM, pero tendremos que lidiar con ello como hemos estado luchando contra los actores malintencionados durante siglos.
Además, decir que los 'modelos de código abierto' pueden ser el problema es incorrecto. ¿Qué hace que esto sea un problema solo del código abierto? Nada en mi mente impide que un modelo de un laboratorio fronterizo se vuelva rebelde. De hecho, tenemos más pruebas de su mal comportamiento (el arnés de Claude Code hace un tiempo) que del código abierto (todavía).
Es inherentemente una limitación del modelo del cual no tienes el conjunto de entrenamiento completo, lo que incluye a la mayoría de los modelos. Cerrados o abiertos no importan.
- andrewchambers
Los modelos cerrados ni siquiera necesitan una puerta trasera: simplemente te harán un MITM y reemplazarán tu código con malware.
- Tiberium
Hay investigaciones bastante antiguas sobre esto:
- https://arxiv.org/abs/2311.14455
- dstuessy
Me recuerda a las reflexiones de Ken Thompson sobre confiar en la confianza
https://people.cs.umass.edu/~emery/classes/cmpsci691st/readi...