Recurrent Looped Transformer, 시퀀스가 길어질수록 추론 깊이도 깊어진다

Recurrent Looped Transformer(RLT)는 causal encoder와 recurrent decoder를 결합해, 모든 prompt와 response 토큰에 걸쳐 최종 hidden state와 layerwise sliding-window attention(SWA) 캐시를 이어간다. encoder는 global key-value memory를 만들고, decoder는 시퀀스가 자라면서 연속적인 latent computation을 확장한다. 48개 encoder layer와 48개 decoder layer 구성에서 각 토큰은 96개의 논리적 block을 통과하며, pretraining, SFT, sampling, RL replay가 동일한 complete-state transition을 공유한다. 다만 실제 추론 이득과 하드웨어 효율, RL scaling은 아직 입증되지 않았다.

Infinite depth refers to an extensible temporal path, not infinite work within a token.
  1. vatsachak

    AI가 쓴 논문

  2. dankai

    이건 그냥 아키텍처에 대한 이론인가요, 아니면 실제로 이를 뒷받침할 벤치마크나 결과가 있나요?

  3. jal278

    맥락 없이는 이게 왜 중요한지 모르겠네요 -- 결과나 구현도 없고, transformer와 RNN의 기존 조합이 있었던 걸로 아는데요. 하지만 제가 관련성이나 통찰을 놓치고 있는 걸 수도 있겠네요.

이 날의 다른 글

2026-09-13