GPT-6 Astra:循环Transformer与隐藏推理
GPT-6 Astra, Looped Transformers, and Hidden Reasoning

OpenAI的GPT-6 Astra刚刚发布,它在3D渲染、动画生成以及计算机使用能力上表现卓越,特别是在ARC-AGI-3基准测试中取得了99.9%的惊人成绩。文章深入探讨了其背后的“循环Transformer”架构,即通过重复使用相同的Transformer块权重来增加推理深度。此外,还分析了关于Astra“隐藏”思维链(Chain of Thought)的传闻,以及OpenAI购买数万台Mac Mini用于强化学习训练以掌握图形界面操作的策略。随着模型对GUI交互的优化,未来LLM将更自然地融入日常计算机任务,而不仅仅是文本处理。
GPT-6 Astra是我目前使用过的最好的模型,它在3D渲染和动画任务上的表现尤为出色,远超其他模型。
HN 评论区
116- shawntan
针对研究型读者,我的博客文章里有一些参考文献,讨论了各类计算问题至少需要多少 CoT(思维链)才能解决:https://blog.wtf.sg/posts/2023-02-03-the-new-xor-problem/
值得一提的是 Will Merrill 的工作:https://arxiv.org/abs/2310.07923
至于通用 Transformer(也就是循环 Transformer,不过大家后来都忘了之前的相关工作)会如何影响这一情况,Will Merrill(再次)在这里有一篇论文(https://arxiv.org/abs/2503.03961)专门讨论了这一点。
最初的通用 Transformer 之所以被称为“通用”,是因为如果你允许针对每个 token 进行循环决策,理论上它可以在不需要 CoT 的情况下达到图灵完备(这里关于精度层级有一些细微差别)。
至于拥有很少或没有 CoT 是否“不安全”:目前尚不清楚模型的 CoT 是否揭示了它们得出答案的真实过程。举个例子,如果它们在生成 CoT 之前就给出了答案怎么办?(https://arxiv.org/html/2603.01437v2)
如果这一点本身都值得怀疑,我们就不能依赖 CoT 来监控模型的推理过程。
一如既往,一旦你深入细节,这个话题就充满了各种细微差别。
- siva7
Astra 在周一之前简直强得离谱,但周二发生了什么事,现在感觉它就像 Sol 一样了。我为失去的生产力感到悲痛,但我希望他们能把原来的 Astra 还给我们。
- wolttam
如果你把一个完整的 Transformer 模型循环作用于自身,那按定义来说就是隐藏推理。
如果模型的输出是它的推理轨迹,而你在推理时只是将其反馈回模型而不是输出它——那么按定义这就是隐藏的(但我预计你可以同时提取出这个轨迹和更下游的最终输出轨迹)。
- andai
MSPAINT 的计算机使用演示让我下巴都惊掉了。
我想它在本质上和 SVG 鹈鹕(SVG pelicans)做的事情差别不大,但看到它能实时运行依然令人惊叹。
- vatsachak
你们到底是怎么使用 LLM 的?怎么会有人觉得 Astra Light 比 Sol High 还差?
- libraryofbabel
所有对 LLM 内部机制感兴趣的人都应该读一读 Sebastian 的文章。他写得很棒。
这里的 TL;DR 是:最近《The Information》的一篇文章 [0] 报道 GPT-6 Astra 使用了“循环深度”或“循环 Transformer
- andai
The Information
- lwarfield
, 这让它听起来像是某种特殊的、令人恐惧的新东西(“秘密技术!”),使得思维链监控变得更难。事实上,这和堆叠更多 Transformer 层是一样的,只不过它复用了权重,从而节省了 GPU 内存。它仍然是一次生成一个 token,token 序列位置之间也没有任何不同于常规 LLM 架构的“循环”交互方式。
所以,你仍然可以很好地监控这些模型的思维链……好吧,如果你是指 OpenAI 的话。自 o1 时代以来,用户就没法看到未总结的轨迹了,因为实验室担心中国实验室会蒸馏他们的模型。
(关于无限堆叠 Transformer 层确实存在一些合理的可解释性问题,但这我们早就知道了。而这里的“循环”并不是任何新问题的根源,除非说它是一种廉价地增加层数的方法。)
[0] https://www.theinformation.com/articles/secret-technique-beh...