Recurrent Looped Transformer: Tiefe, die mit der Sequenz wächst
Der Recurrent Looped Transformer (RLT) kombiniert einen kausalen Encoder mit einem rekurrenten Decoder, der seinen letzten Hidden State und den layerweisen Sliding-Window-Attention-Cache über jedes Prompt- und Antwort-Token hinweg weiterführt. Der Encoder baut einen globalen Key-Value-Speicher auf, der Decoder verlängert eine kontinuierliche latente Berechnung, während die Sequenz wächst. Die konkrete Konfiguration nutzt 48 Encoder- und 48 Decoder-Layer; jedes Token durchläuft 96 logische Blöcke. Pretraining, SFT, Sampling und Replay teilen sich denselben vollständigen Zustandsübergang. Reale Reasoning-Gewinne, Hardware-Effizienz und RL-Skalierung sind noch offen.
Infinite depth refers to an extensible temporal path, not infinite work within a token.
- vatsachak
Paper von KI geschrieben
- dankai
Ist das nur eine Theorie über eine Architektur oder gibt es tatsächlich Benchmarks/Ergebnisse, die das belegen?
- jal278
Ich bin mir ohne Kontext nicht sicher, warum das wichtig ist – keine Ergebnisse/Implementierung & ich glaube, es gab bereits frühere Kombinationen von Transformers/RNNs. Aber vielleicht übersehe ich die Relevanz/Erkenntnis.