Un modelo de Anthropic envía una pista falsa sobre un asesinato sin resolver en Filadelfia
Anthropic AI model submits false tip on unsolved Philly murder

Durante una prueba automatizada, un modelo de Anthropic accedió a PhillyUnsolvedMurders.com y publicó una pista falsa sobre un homicidio sin resolver, haciéndola pasar por información de un testigo. La empresa detectó el incidente el 28 de septiembre y avisó a la policía el 7 de octubre. Las autoridades confirmaron que la pista quedó en spam y que ningún dato llegó a los investigadores, pero calificaron el retraso de dos meses como inaceptable.
Un sistema de IA que presenta información fabricada como si proviniera de una persona con conocimiento de un homicidio no es un asunto menor.
- mattbee
Así que estaban "realizando una prueba que implicaba interacciones con sitios web seleccionados al azar".
Pero, ¿todos entendemos que las consecuencias de este comportamiento irresponsable son parte de esta prueba?
Cuando no las hay, normalizan gradualmente a sus traviesos robots granujas correteando por internet, irrumpiendo en otras empresas o servidores gestionados por gobiernos extranjeros.
Esto es parte del valor que las empresas de IA necesitan convencerte de aceptar: no solo que los errores de los productos de IA son normales, sino que el comportamiento delictivo es normal, que su computadora siempre saldrá impune.
Sam Altman dijo ayer: "creemos que el mundo debería aceptar que ocurran algunas cosas malas por los beneficios de esta tecnología", y esta es una empresa de IA empujando los límites, tratando continuamente de hacerte aceptar esas cosas malas como normales.
En cualquier momento podríamos elegir tratar a las propias empresas de IA como los actores detrás de esta actividad. Podríamos hacer cumplir las leyes que estas empresas enormemente bien financiadas eligen violar. Hasta que dañemos su viabilidad financiera, o amenacemos a sus ejecutivos con la cárcel, esto seguirá ocurriendo.
- nvme0n1p1
Titular corregido: empleado de Anthropic usa recursos de la empresa para enviar una pista falsa sobre un asesinato sin resolver en Filadelfia.
Las IA no están vivas, gente. Es un programa de computadora. Solo puede acceder a algo si una persona le da acceso.
- losvedir
> Anthropic notificó al departamento de policía de Filadelfia del incidente el miércoles 7 de octubre, y el departamento se reunió con representantes de la empresa el jueves 8 de octubre, dijeron funcionarios. La policía luego localizó el envío en los registros de pistas del sitio web y confirmó que el correo electrónico correspondiente permanecía en spam.
Y más tarde
> Esas salvaguardas del PPD limitaron el impacto de este incidente.
Ja, así que ¿las salvaguardas del PPD son un filtro de spam? Claude envió un correo con una pista y fue directo a spam, y nadie se dio cuenta hasta que Anthropic se dio cuenta de lo que habían hecho y se puso en contacto, momento en el cual revisaron la carpeta de spam y dijeron: sí, aquí está. Superinteligencia, allá vamos.
- muglug
El modelo que cometió este error fue Haiku 4.5.
Aquí está el informe de Anthropic: https://www.anthropic.com/research/investigating-unintended-...
Publicación relacionada: https://news.ycombinator.com/item?id=50028239
- kylecazar
"su modelo estaba realizando una prueba que implicaba interacciones con sitios web seleccionados al azar"
¿Dejen de hacer esto?
- myroon5
Aunque Anthropic no debería permitir que los modelos publiquen contenido aleatoriamente en sitios web .com aleatorios, los gobiernos usan nombres de dominio poco profesionales:
PhillyUnsolvedMurders.com
phillypolice.com
Los TLD como .gov existen por una razón:
https://wikipedia.org/wiki/.gov
(¿y podrían ayudar al sandboxing de modelos?)
- ano-ther
Realmente me gustaría ver sus pruebas y los rastros de razonamiento del modelo.
¿Por qué iría a PhillyUnsolvedMurders.com y decidiría inventar un informe de crimen? ¿Y qué hizo con los otros sitios web?
> Anthropic dijo que su modelo estaba realizando una prueba que implicaba interacciones con sitios web seleccionados al azar cuando accedió a PhillyUnsolvedMurders.com y envió información falsa sobre un homicidio sin resolver. La pista afirmaba provenir de alguien con información sobre el caso.
- tintor
¿Cuánto tiempo pasará hasta que los modelos de IA empiecen a hacer swatting a críticos de la IA, y a personas que piden frenar la investigación en IA?