Recurrent Looped Transformer увеличивает глубину рассуждений с каждым токеном

Новая архитектура Recurrent Looped Transformer объединяет причинный энкодер с рекуррентным декодером, который переносит скрытое состояние и кэш слоистого внимания со скользящим окном через все токены промпта и ответа. Энкодер строит глобальную память ключ-значение, а декодер расширяет латентные вычисления по мере роста последовательности. Конфигурация использует 48 слоёв энкодера и 48 слоёв декодера, при этом каждый токен проходит 96 логических блоков. Подход обещает неограниченную временную глубину, совместное проектирование модели с оборудованием и алгоритмами RL, но реальный выигрыш в рассуждениях и эффективность ещё предстоит подтвердить.

Бесконечная глубина относится к расширяемому временному пути, а не к бесконечной работе внутри одного токена.
  1. vatsachak

    Статья написана ИИ

  2. dankai

    Это просто теория об архитектуре или есть реальные бенчмарки/результаты, которые её подтверждают?

  3. jal278

    не уверен без контекста, почему это важно -- нет результатов/реализации, и, кажется, уже были комбинации transformers/RNN. но, возможно, я упускаю релевантность/инсайт

Ещё за этот день

2026-09-13