Recurrent Looped Transformer: profundidad que crece con la secuencia

El Recurrent Looped Transformer (RLT) combina un encoder causal con un decoder recurrente que conserva su estado oculto final y la caché de atención de ventana deslizante (SWA) a lo largo de cada token de prompt y respuesta. El encoder construye una memoria global de clave-valor; el decoder extiende un cómputo latente continuo a medida que la secuencia crece. El diseño integra razonamiento latente con profundidad temporal ilimitada, co-diseño modelo-hardware y co-diseño modelo-algoritmo de RL. Las ganancias reales en razonamiento, eficiencia de hardware y escalado de RL aún están por establecerse.

La profundidad infinita se refiere a una ruta temporal extensible, no a trabajo infinito dentro de un token.
  1. vatsachak

    Paper escrito por IA

  2. dankai

    ¿Es esto solo una teoría sobre una arquitectura o hay realmente algunos benchmarks/resultados que lo sustenten?

  3. jal278

    no estoy seguro sin contexto de por qué esto es importante -- no hay resultados/implementación y creo que hay combinaciones previas de transformers/RNNs. pero quizás me estoy perdiendo la relevancia/idea

Más de este día

2026-09-13