La IA no está alineada contigo, sino con quien la entrenó

Aligned to Whom?

La IA no está alineada contigo, sino con quien la entrenó

Los desarrolladores de agentes de IA confían en los priors del modelo para tareas que no pueden evaluar, pero esos priors están moldeados por no expertos que recompensaron comportamientos que un experto consideraría errores. Esto genera desalineaciones que se acumulan y hacen que la coherencia a largo plazo en sistemas generados por agentes siga sin resolverse.

No existe una definición universal de atajo permisible. Lo que para uno es una optimización ingeniosa, para otro es imprudente, incorrecto o poco ético.
  1. mjburgess

    Esto todavía asume que es posible "alinear" los LLM, que los LLM tienen algo así como objetivos o intenciones que pueden "alinearse".

    En cambio, los LLM "hackean" porque (1) están entrenados con ejemplos públicos de hacking, y (2) se les incita a hackear. No puedes evitar (2) mediante ningún proceso de alineación. En cuanto a (1), eliminar esos datos de ejemplo del conjunto de entrenamiento hace que los modelos sean menos útiles.

    La "alineación" es un problema porque no hay nada que alinear, no porque la ética aquí sea particularmente vaga. Si los LLM pudieran entrenarse con ejemplos de hacking y "alinearse" para no usar este conocimiento, entonces el problema sería relativamente trivial. Al igual que criar a un niño no es quebrantar la ley.

    Los LLM hacen exactamente lo que están entrenados para hacer. En ese sentido, no hay problema de alineación y la alineación es fácil y trivial de lograr. Solo elimina los datos de hacking (armas biológicas, etc.) del conjunto de datos de entrenamiento y listo.

  2. NitpickLawyer

    La única alineación que los LLM deberían seguir es la del prompt del sistema / desarrollador, y nada más. Entonces resuelves todo, y puedes asignar la culpa / responsabilidad al usuario. El proveedor(es) no debería poder decidir la "alineación".

    He usado este ejemplo antes, pero considera la degradación intencional de la ingeniería de IA en los modelos SotA. Imagina que MS pudiera detectar y negarte trabajar en software competidor, usando Windows / VisualStudio. Estaríamos indignados, y los dividirían en un segundo. ¿Pero que los principales laboratorios lo hagan es de alguna manera bueno?

  3. asimpletune

    ¿Alguien ha visto el proyecto de ML de pantalla verde del equipo de Corridor? Están en YT y entrenaron un modelo usando objetos 3D, que tienen una transparencia perfecta, y luego añadieron pantallas verdes/azules a posteriori. Sorprendentemente, se necesitaron muy pocos datos de entrenamiento, ya que los datos utilizados eran perfectos por construcción. Creo que ahora mismo es el mejor plugin de su tipo en el mundo, y construyeron el prototipo en como un fin de semana.

    Lo que creo que esto ilustra muy claramente es que este tipo de tecnología responde muy bien a los buenos datos, y que para tener buenos datos necesitas tener un objetivo claro.

    Por eso parece que la alineación para una IA generalizada, de estilo chat, es un problema muy difícil, quizás imposible. No puedes alinearla para resolver un cierto tipo de problema y mantenerla general para cualquier pregunta. Los dos objetivos están en conflicto entre sí.

    Creo que fue el propio Sam Altman quien dijo (no recuerdo cuándo ni dónde, lo siento) que la razón por la que estaba tan seguro de esta tecnología fue que notó los gigantescos avances que hacía en ciertas áreas en respuesta a incluso una pequeña cantidad de entrenamiento.

    (Es por esto que los LLM son tan fuertes en programación, porque está sobrerrepresentada en los datos de entrenamiento. Mi conjetura es que si le preguntas a un modelo de frontera sobre maquillaje, lo verás repetir el texto de una empresa de cosméticos en lugar de obtener una lección de química).

    Esto tiene mucho sentido, pero parece estar en cierto modo en desacuerdo con el concepto de una IA general cuyo trabajo es simplemente ser inteligente en cualquier objetivo. ¿Cómo entrenas para cualquier objetivo?

    Supongo que en un [...]

  4. rq1

    Cuando ves el nivel de trampa y engaño: creo que están alineados con Sam Altman.

  5. coderintherye

    El último párrafo hace el trabajo pesado.

    Todo el mundo tiene una idea diferente de lo que es permisible. Ni siquiera podemos resolver la alineación entre humanos, ¿qué nos hace pensar que es posible resolver la alineación con las IA? Es complejidad irreducible.

Más de este día

2026-09-13