Cerebras 与 OpenAI 联手加速 GPT-5.6 Sol
Accelerating GPT-5.6 Sol Ultrafast

Cerebras 与 OpenAI 正式推出 Ultrafast 模式,为 GPT-5.6 Sol 带来前所未有的推理速度。该模式在 OpenAI API 中率先上线,每秒可输出高达 750 个 token,且完全不牺牲模型质量。在 Humanity's Last Exam 基准测试中,GPT-5.6 Sol Ultrafast 仅用 11 小时 11 分钟便完成了 2500 道高难度问题,速度是 Claude Fable 5 的 7 倍。这一突破得益于 Cerebras 的 Wafer-Scale Engine 架构,通过消除数据移动瓶颈,让前沿智能真正适配对时间敏感的关键任务。无论是处理法律简报、金融模型,还是应对网络安全攻击,Ultrafast 都能让 AI 实时跟上人类的思考节奏,彻底改变工作流。
凭借 GPT-5.6 Sol Ultrafast,Cerebras 让 AI 能够跟上你的思考、编码与协作节奏。
HN 评论区
272- iamcoder18
我等了这么久,就盼着 OpenAI 和 Cerebras 的合作能搞出点惊天动地的东西。
> 在我们的评估中,GPT-5.6 Sol 在 Ultrafast 模式下,仅用 11 小时 11 分钟就答完了全部 2500 道 HLE 题目。而 Claude Fable 5 则耗时 78 小时 27 分钟,也就是连续计算超过三天,才得出相同的结论。换句话说,Ultrafast 模式在一个工作日内就攻克了人类知识的边界,同时以近 7 倍的速度实现了相当的准确率。
这简直离谱。
希望 Terra 和 Luna 也能尽快发布 Ultrafast 版本。
- csallen
人们往往低估了速度对思维质量的重要性,因为人们低估了质量在多大程度上源于简单的迭代。
当 LLM 思考时,通常只做一次遍历。它从上到下、从头到尾输出 token,然后就结束了。但人类思考时,尤其是思维敏捷的人,通常会即时迭代和修正想法。我们会进行多次遍历。我们会停下重来,重新考虑,回顾审视,重新评估。有时候我们做得太快太自动,甚至都没意识到自己在做这些。我认为,高智商或高效的人与其他人的区别,往往不在于他们第一遍思考的质量,而在于他们在相同时间内能多做多少次额外的遍历,当然还有他们在回顾过程中习惯考虑哪些标准。
对此进行内省很难,但用 LLM 做实验却很容易。首先,让 LLM 做点复杂的事。比如,想出一个新商业点子,或者规划下个月的生活等等。等它做完后,告诉它:
“先列出一份合适的评估标准清单,然后根据这些标准审查你刚才写的内容。接着,基于审查结果,如果有必要,迭代并生成一个更好的回答。”
你会发现,下一个回答通常会好得离谱。它往往能捕捉并消除大量的幻觉、逻辑错误和效率低下的地方……
- Topfi
除非我漏看了什么,除了那个智能与速度对比图中的动画(该动画仅提及内部数据,并未说明是否真正重跑了 AA 测试套件),关于性能这一关键方面,并没有任何确凿的陈述。
Cerebras 或 OpenAI 的帖子 [0] 都没有明确说明其表现与常规版 5.6 Sol 完全一致。如果这仅仅是速度更快的 5.6 Sol,他们理应(并且会)大肆宣扬。像“性能完全一致,只是更快,且没有任何副作用”这样的表述,对于清晰传达信息至关重要。再加上没有任何定价信息,我打算先观望,等更多信息出来再说。
- GodelNumbering
对应的 OpenAI 帖子:https://openai.com/index/previewing-ultrafast/
没有任何定价信息,这可能意味着“如果你得问价格,那就太贵了”,或者他们只是在决定前先探探市场兴趣。
- wxw
> 与 Artificial Analysis 报告的输出速度相比,Ultrafast 模式下的 GPT-5.6 Sol 比 Fable 5 快 11 倍,比 Fast 模式下的 Opus 4.8 快 5 倍。
太棒了。我个人对更快的模型/推理非常兴奋。
我觉得在当前的讨论中,速度的价值在某种程度上被低估了。有一段时间,我大量使用 Cursor 的 Composer,甚至超过了前沿模型,仅仅因为它该死地快。
- ricardobeat
对比图中遗漏了 6 月发布的 Mimo v2.5-Pro Ultraspeed(可达 1000tok/s),这是一个有趣的缺陷。
虽然它有点过时(得分低 ±40%),但对于许多编程任务来说已经足够聪明,而且成本可能不到 Sol 的十分之一。
- johnfn
这看起来确实非常惊人,但别忘了,惊人的 token 吞吐量只能解决特定的瓶颈。如果你的端到端测试需要一小时,Ultracode 之后依然需要一小时。如果代理在更改后运行 10 分钟的类型检查,那依然需要 10 分钟。在庞大的代码库上运行 grep 依然一样慢,等等。我说这些不是为了抹杀这项成就,而是希望大家对此保持清醒的头脑——14 倍的 token 速度并不意味着每项任务都能快 14 倍。
我怀疑 Humanity's Last Exam 并没有包含工具调用,这使得它成为突出 Ultrafast 速度的完美基准,但这与我们日常的工作并不完全相同。
- tristanMatthias
> GPT-5.6 Sol 在 Ultrafast 模式下,输出速度高达每秒 750 个 token
> 在 Llama 3.1 8B 模型上,每位用户每秒可交付 17k 个 token。
显然这是一个小得多的模型,但我真的迫不及待想看到 ASIC 接管 LLM 领域。
想象一下,在你自己的 ASIC 硬件上运行像 Sol/Fable 这样的模型(即使只有一半大小,保留 60-70% 的智能)。