Recurrent Looped Transformer увеличивает глубину рассуждений с каждым токеном
Новая архитектура Recurrent Looped Transformer объединяет причинный энкодер с рекуррентным декодером, который переносит скрытое состояние и кэш слоистого внимания со скользящим окном через все токены промпта и ответа. Энкодер строит глобальную память ключ-значение, а декодер расширяет латентные вычисления по мере роста последовательности. Конфигурация использует 48 слоёв энкодера и 48 слоёв декодера, при этом каждый токен проходит 96 логических блоков. Подход обещает неограниченную временную глубину, совместное проектирование модели с оборудованием и алгоритмами RL, но реальный выигрыш в рассуждениях и эффективность ещё предстоит подтвердить.
Бесконечная глубина относится к расширяемому временному пути, а не к бесконечной работе внутри одного токена.
- vatsachak
Статья написана ИИ
- dankai
Это просто теория об архитектуре или есть реальные бенчмарки/результаты, которые её подтверждают?
- jal278
не уверен без контекста, почему это важно -- нет результатов/реализации, и, кажется, уже были комбинации transformers/RNN. но, возможно, я упускаю релевантность/инсайт