Recurrent Looped Transformer: profundidad que crece con la secuencia
El Recurrent Looped Transformer (RLT) combina un encoder causal con un decoder recurrente que conserva su estado oculto final y la caché de atención de ventana deslizante (SWA) a lo largo de cada token de prompt y respuesta. El encoder construye una memoria global de clave-valor; el decoder extiende un cómputo latente continuo a medida que la secuencia crece. El diseño integra razonamiento latente con profundidad temporal ilimitada, co-diseño modelo-hardware y co-diseño modelo-algoritmo de RL. Las ganancias reales en razonamiento, eficiencia de hardware y escalado de RL aún están por establecerse.
La profundidad infinita se refiere a una ruta temporal extensible, no a trabajo infinito dentro de un token.
- vatsachak
Paper escrito por IA
- dankai
¿Es esto solo una teoría sobre una arquitectura o hay realmente algunos benchmarks/resultados que lo sustenten?
- jal278
no estoy seguro sin contexto de por qué esto es importante -- no hay resultados/implementación y creo que hay combinaciones previas de transformers/RNNs. pero quizás me estoy perdiendo la relevancia/idea