Recurrent Looped Transformer: Tiefe, die mit der Sequenz wächst

Der Recurrent Looped Transformer (RLT) kombiniert einen kausalen Encoder mit einem rekurrenten Decoder, der seinen letzten Hidden State und den layerweisen Sliding-Window-Attention-Cache über jedes Prompt- und Antwort-Token hinweg weiterführt. Der Encoder baut einen globalen Key-Value-Speicher auf, der Decoder verlängert eine kontinuierliche latente Berechnung, während die Sequenz wächst. Die konkrete Konfiguration nutzt 48 Encoder- und 48 Decoder-Layer; jedes Token durchläuft 96 logische Blöcke. Pretraining, SFT, Sampling und Replay teilen sich denselben vollständigen Zustandsübergang. Reale Reasoning-Gewinne, Hardware-Effizienz und RL-Skalierung sind noch offen.

Infinite depth refers to an extensible temporal path, not infinite work within a token.
  1. vatsachak

    Paper von KI geschrieben

  2. dankai

    Ist das nur eine Theorie über eine Architektur oder gibt es tatsächlich Benchmarks/Ergebnisse, die das belegen?

  3. jal278

    Ich bin mir ohne Kontext nicht sicher, warum das wichtig ist – keine Ergebnisse/Implementierung & ich glaube, es gab bereits frühere Kombinationen von Transformers/RNNs. Aber vielleicht übersehe ich die Relevanz/Erkenntnis.

Mehr von diesem Tag

2026-09-13