GPT-6 Astra: почему OpenAI скрывает цепочки рассуждений
GPT-6 Astra, looped transformers, and hidden reasoning

Себастьян Рашка разбирает архитектуру GPT-6 Astra: слухи о looped transformers и скрытых цепочках рассуждений. Модель показывает 99,9% на ARC-AGI-3 против 7,8% у GPT-5.6 Sol, но в агентных бенчмарках отрыв скромнее. Автор объясняет, как looped-трансформеры переиспользуют веса и почему это может маскировать reasoning trace, а также делится наблюдениями об обучении computer use на Mac Mini.
Astra is the best model I’ve used so far, and it’s disproportionately good at 3D rendering and animation tasks (relative to other models).
- shawntan
Для тех, кто занимается исследованиями: в моём блогпосте есть ссылки на то, какие вычислительные задачи минимально требуют какого объёма CoT для решения: https://blog.wtf.sg/posts/2023-02-03-the-new-xor-problem/
Особенно отмечу работу Will Merrill: https://arxiv.org/abs/2310.07923
Что касается того, как universal transformers (зацикленные трансформеры, но все уже забыли предыдущие работы) на это повлияют, у Will Merrill (опять) есть статья (https://arxiv.org/abs/2503.03961), где это как раз обсуждается.
Оригинальный universal transformers называется «универсальным», потому что если разрешить решения о зацикливании на каждый токен, он теоретически может быть тьюринг-полным без необходимости в CoT (есть нюансы насчёт используемых уровней точности).
Что касается того, является ли наличие малого или отсутствующего CoT «небезопасным»: неясно, действительно ли CoT модели раскрывает, как она на самом деле приходит к ответу. Например, что если они дают ответ до CoT? (https://arxiv.org/html/2603.01437v2)
Если это уже под вопросом, нам не стоит полагаться на CoT для мониторинга рассуждений модели.
Как всегда, в этой теме много нюансов, как только начнёшь копаться в деталях.
- siva7
Astra была безумной до понедельника, но во вторник что-то случилось, и теперь она ощущается как Sol. Я скорблю по потерянной продуктивности, но надеюсь, что нам могут вернуть оригинальную Astra.
- wolttam
Если зациклить всю модель-трансформер на саму себя, это, по определению, похоже на скрытые рассуждения.
Если выход модели — это её трасса рассуждений, и вы просто снова подаёте её на вход модели на этапе инференса вместо того, чтобы выводить, — то это по определению скрыто (но я ожидаю, что вы могли бы вытащить и эту трассу, и более глубокую финальную выходную трассу).
- andai
Демо использования компьютера в MSPAINT заставило мою челюсть отвиснуть.
Полагаю, с точки зрения того, что оно делает, это не сильно отличается от SVG-пеликанов, но всё равно потрясающе видеть, как это работает в реальном времени.
- libraryofbabel
Всем, кто интересуется внутренностями LLM, стоит почитать Sebastian. Он классный.
Суть в том, что недавняя статья в «The Information»[0], сообщавшая, что GPT 6 Astra использовала «recurrent depth» или «looped transformers», создала впечатление, будто это какая-то особая новая страшная штука («секретная техника!»), которая затрудняет мониторинг цепочек рассуждений. На самом деле это то же самое, что наращивание большего числа слоёв трансформера, только с переиспользованием весов, что экономит память GPU. Модель по-прежнему выдаёт по одному токену за раз, и позиции в последовательности токенов не взаимодействуют каким-то «рекуррентным» образом, отличным от обычной архитектуры LLM.
Так что мониторить цепочку рассуждений у таких моделей всё ещё вполне можно... ну, если вы OpenAI, конечно. Пользователи не могли видеть несуммированную трассу ещё со времён o1, потому что лаборатории беспокоятся о дистилляции их моделей китайскими лабораториями.
(Есть некоторые законные опасения по интерпретируемости бесконечного наращивания слоёв трансформера, но мы знаем об этом уже давно. И «зацикливание» здесь на самом деле не источник каких-либо новых проблем, разве что это дешёвый способ добавить больше слоёв.)
[0] https://www.theinformation.com/articles/secret-technique-beh...
- hankbond
Какая ясная и хорошо написанная статья. У меня лишь базовое понимание архитектуры LLM, но я смог следить за всем и всё время выстраивать интуицию!
- andai
> Я хочу предотвратить гонку к неотслеживаемости, запущенную путаным репортажем. Глубина вычислительного графа наших нынешних фронтирных моделей, включая Astra, находится в пределах фактора двух от GPT-4. OpenAI работала над сохранением и использованием мониторинга цепочек рассуждений с самых первых наших reasoning-моделей. Мы глубоко заботимся об этой технике, поскольку она может дать нам представление о том, как выравнивание модели обобщается за пределы её обучающего распределения. Я действительно считаю, что она хрупка и, к сожалению, имеет тенденцию к ухудшению по причинам, не связанным с изменениями архитектуры, о которых я скоро напишу. Но есть вещи, которые мы можем сделать, чтобы её усилить, и это ключевая цель нашей текущей исследовательской программы.
- Jakub Pachocki (главный научный сотрудник OpenAI)
Интересно, насколько это на самом деле полезно для выравнивания? Разве мы уже не выяснили, что они знают, когда их оценивают, и просто говорят то, что, по их мнению, вы хотите услышать?
- andai
Анекдотично, но я испытал зацикленное мышление на своеобразной комбинации веществ.
Я мог обращаться с мыслями как с твёрдыми объектами и итеративно ими манипулировать. (Обычно они больше похожи на «проблески» или «вспышки», которые быстро угасают. Так что, полагаю, это было бы мысленным эквивалентом трассеров.)
Я мог складывать мысли друг на друга, как доски. (Я могу делать нечто подобное и в узких пределах, но доски далеко не такие широкие!)
К сожалению, я не проводил никаких тестов, но субъективно моё мышление было значительно усилено. (Потратил несколько лет, догоняя озарения, которые у меня были в тот вечер.)
Может быть, не связано, но часть про «looped transformers» заставила меня задуматься, нет ли здесь похожего «пошагового» приращения.
Edit: Ладно, 6.8–18% — это чуть менее драматично, чем то, что я имел в виду.