Recurrent Looped Transformer, 시퀀스가 길어질수록 추론 깊이도 깊어진다
Recurrent Looped Transformer(RLT)는 causal encoder와 recurrent decoder를 결합해, 모든 prompt와 response 토큰에 걸쳐 최종 hidden state와 layerwise sliding-window attention(SWA) 캐시를 이어간다. encoder는 global key-value memory를 만들고, decoder는 시퀀스가 자라면서 연속적인 latent computation을 확장한다. 48개 encoder layer와 48개 decoder layer 구성에서 각 토큰은 96개의 논리적 block을 통과하며, pretraining, SFT, sampling, RL replay가 동일한 complete-state transition을 공유한다. 다만 실제 추론 이득과 하드웨어 효율, RL scaling은 아직 입증되지 않았다.
Infinite depth refers to an extensible temporal path, not infinite work within a token.