Investigador de IA renuncia a Anthropic y advierte que la IA podría matarnos a todos
Gambling with our lives: AI researcher quits Anthropic with warning about safety

Jacob Coxon, investigador que trabajó en Anthropic y antes en OpenAI, renunció y advirtió que ambas compañías "juegan con nuestras vidas" al competir por una superinteligencia autorreparable. Evan Hubinger, responsable de alineación en Anthropic, respaldó sus dichos y estimó en más del 10% la probabilidad de que la IA acabe con la humanidad esta década, sin un plan claro para evitarlo.
Las personas que construyen IA creen sinceramente que podría matarnos a todos para el final de la década.
- themgt
El punto fundamental que creo que se confunde con demasiada frecuencia es la diferencia entre un LLM y un sistema agéntico.
Un LLM no puede hacer nada más que generar tokens. Ejecutas tu LLM en vLLM o lo que sea, y genera tokens de salida basados en tus tokens de entrada. ¡Eso es todo!
Luego los humanos construyen sistemas ~deterministas para tomar esos tokens y hacer todo tipo de cosas con ellos, como realizar acciones en el mundo real. Y después podemos retroalimentar la salida de esas acciones al LLM y generar más tokens. Y luego nuestros sistemas pueden usar los nuevos tokens para realizar nuevas acciones en el mundo real.
Los humanos quieren culpar a la "IA" por atacar HuggingFace o una wiki alemana o lo que sea, pero:
1) LLM - no puede apoderarse de la wiki alemana porque solo genera tokens
2) sistema agéntico con acceso a internet, un prompt que le dice que ataque cosas, ejecutándose en un entorno de CI compartido para que los agentes puedan hacer brainstorming en artifactory
Nada de 2 es "IA", es redes estándar y Markdown y máquinas virtuales de CI, etc. etc. No hay IA por ningún lado. CPUs, ni siquiera GPUs. Solo sistemas deterministas gestionados en última instancia por humanos. Y un sistema-1 10 veces más potente puede seguir generando datos inertes 10 veces "más inteligentes".
Si la humanidad y las organizaciones humanas deciden colectivamente volcar los tokens generados por el sistema-1 en nuestros sistemas-2 deterministas, sobre los que tenemos control total, de vuelta a los sistemas-1, en un bucle yolo, de tal manera que perdemos el control y eso acaba con la humanidad, bueno...
"La moneda no tiene voz. Solo eres tú".
- koolba
> Evan Hubinger, el líder de personal de Anthropic encargado de mantener la tecnología alineada con los objetivos y valores humanos, respaldó las afirmaciones de Coxon en una publicación de seguimiento propia, aunque no renunció a la empresa.
> "Jacob tiene razón aquí — realmente creemos sinceramente que la IA podría matar a todos los humanos", dijo.
> Hubinger estimó que las probabilidades de que eso ocurra son superiores al diez por ciento en la próxima década, y añadió que todavía no hay un plan sobre cómo mantener la IA alineada con los objetivos humanos en el escenario de superinteligencia.
Una probabilidad del 10% de que matemos a todo el mundo es un precio pequeño a pagar por remixes de Motown de canciones clásicas de 2pac.
- brunorsini
Me gusta especialmente el último punto que menciona:
No subestimen el poder de esta tecnología. Pronto serán sistemas sobrehumanos que podrán hackear cualquier cosa, revolucionar cualquier campo de la noche a la mañana y adquirir poder y recursos reales.
Es interesante ver tanto odio hacia los creadores que usan IA para hacer casi cualquier tipo de trabajo creativo. Al menos son humanos usándola como "herramientas controlables". Bicicletas nucleares para la mente.
A medida que aumenta el grado de separación, las cosas pueden ponerse interesantes. "Crea varias cuentas de redes sociales, publica lo que sea, maximiza vistas e interacción, devuélveme los números agregados". "Ahora promociona <x>".
Y luego las decisiones de hacer cosas así podrían pronto estar ocurriendo de forma autónoma, como un paso más en una serie de razonamientos destinada a lograr algún otro objetivo más amplio.
Los modelos/pesos abiertos podrían terminar desempeñando un papel particularmente importante aquí. Los usuarios podrían, consciente o inconscientemente, eludir la seguridad derivada del prompt del sistema que podría haber ofrecido una protección muy necesaria.
- negura
Realmente creo que serían capaces de hundirse tan bajo y pagarle para que renuncie y publique esto, solo para generar un poco más de hype antes de la IPO.
- WalterGR
"Renuncié a Anthropic hoy" (twitter.com/hilbertspaess)
https://news.ycombinator.com/item?id=49619227
564 puntos | hace 9 horas | 766 comentarios
- devinprater
Awww, la empresa creada para asustar a la gente se asusta a sí misma. El empleado asustado renuncia. La acción sube porque nos encanta contarnos historias de miedo unos a otros.
- conqueso
Me resulta difícil imaginar cómo la IA podría ser una amenaza existencial. ¿La idea general es que a medida que los LLM mejoren se integrarán en más sistemas donde el riesgo de mal funcionamiento se volverá literalmente peligroso? Por ejemplo, controlar reactores nucleares.
- glimshe
¿Qué opina la gente en China sobre esto? Aunque sus modelos estén muy por detrás, no están años por detrás. Si frenamos a las empresas estadounidenses, suponiendo que eso sea deseable, no haría nada para disuadir a China y el apocalipsis de la IA llegaría de todos modos en poco tiempo.