¿Cuán preocupados deberíamos estar por la arquitectura recurrente de Astra?
How concerned should we be about Astra's recurrent architecture?
Astra, el modelo de IA de recurrencia profunda de Google, desafía el dominio de los Transformers al lograr un rendimiento comparable con un coste computacional significativamente menor. Este análisis examina los posibles riesgos y beneficios de su arquitectura, desde la eficiencia energética hasta las implicaciones para la seguridad de la IA, y plantea preguntas cruciales sobre si su adopción generalizada podría acelerar el desarrollo de sistemas más capaces o introducir vulnerabilidades imprevistas.
La arquitectura recurrente de Astra podría reducir el coste de la inferencia en un orden de magnitud, pero también podría hacer que los modelos sean más difíciles de interpretar y controlar, lo que plantea nuevos desafíos para la alineación.
- mentalgear
Entonces, la postura de OpenAI sobre la interpretabilidad (seguridad de la IA) ahora es básicamente ese meme de los Blues Brothers: dos tipos con gafas de sol oscuras, conduciendo de noche en un coche con el parabrisas roto, a todo gas, preguntando: "¿Qué podría salir mal?"
- khalic
Tenía la impresión de que los tokens intermedios ("cadena de pensamiento") _no_ son una representación del camino lógico de un modelo, y un estudio observó que se pueden reemplazar los tokens intermedios con cadenas de un solo carácter y aún así obtener la mayor precisión...
- samrus
Me gusta la idea de más recurrencia a nivel de transformador. La cadena de pensamiento siempre me pareció torpe. Simplemente no es la forma en que el cerebro humano procesa la información. Es una aproximación extremadamente burda en el mejor de los casos.
- kjshsh123
>En contraste con una RNN clásica, no hay un estado oculto sin límites que se acumule a lo largo de toda una trayectoria.
No entiendo esta línea. En una RNN clásica, el estado oculto tiene una dimensión limitada. De hecho, son los transformadores los que técnicamente tienen un estado oculto sin límites.
No se pueden paralelizar las RNN no lineales clásicas por varias razones, pero en el entrenamiento tanto las RNN como los transformadores dependen de todo el historial de la secuencia de una manera que no tiene límites. Por supuesto, en la práctica solo entrenas con una longitud máxima de secuencia.
RNN xhat[t+1]=f(x[t],h[t])
Transformador/autoatención xhat[t+1]=f(x[t],h[t],h[t-1],...,h[1])
- anon373839
Sebastian Raschka publicó sobre esta arquitectura:
> Hay mucho revuelo en torno al modelo Astra de OpenAI en mi timeline hoy. Aparentemente, esto se remonta a un nuevo artículo de The Information, que decía que Astra es un "transformador recurrente en profundidad o en bucle".
> Siempre es interesante leer sobre enfoques nuevos o diferentes (incluidos rumores sobre lo que los laboratorios cerrados pueden estar haciendo), pero desmitifiquemos un poco esto.
> Hace unos 2 meses, compartí los detalles de la arquitectura de Nanbeige, por ejemplo, donde "Nanbeige4.2-3B se preentrena desde cero con 28T tokens con un transformador en bucle que reutiliza la pila de capas para aumentar la capacidad sin agregar parámetros".
> Sí, eso es. La idea del transformador en bucle es simplemente reutilizar capas en el bloque del transformador.
> En el caso de Nanbeige, la idea principal es reutilizar la misma pila de 22 capas (=bloque del transformador) dos veces en lugar de una. Así que, efectivamente, extiende la arquitectura de 22 capas a 44 capas, pero sin duplicar los pesos.
> En términos simples, esto aproximadamente duplica el tamaño del modelo (si ignoramos las capas de incrustación y salida por un momento). Pero en lugar de requerir 2 veces el almacenamiento y la RAM para alojar este modelo, se mantiene en el mismo tamaño ya que reutilizamos los componentes. Sin embargo, es casi 2 veces más caro en términos de cómputo, porque ejecutamos el texto incrustado a través de casi 2 veces más capas.
> ¿Por qué? En el informe técnico de Nanbeige 4.2, los investigadores encontraron que dos pasadas daban la mejor compensación y retenían alrededor del 75% de la eficiencia de tokens [...]