CerebrasとOpenAI、GPT-5.6 Solを毎秒750トークンで実行するUltrafastモードを発表
Accelerating GPT-5.6 Sol Ultrafast

CerebrasとOpenAIは、GPT-5.6 Solを毎秒750トークンで実行するUltrafastモードを発表した。このモードは、CerebrasのWafer-Scale Engineアーキテクチャを活用し、品質を損なうことなく11倍高速な推論を実現する。Humanity's Last Examでは、Claude Fable 5より約7倍速く回答し、GDP-Valでは5.6倍のエンドツーエンド高速化を達成した。現在は限定的なプレビューとして提供され、今後アクセスが拡大される。
「GPT-5.6 Sol Ultrafastにより、Cerebrasはあなたの思考、コーディング、コラボレーションのペースに追いつくAIを実現します。Ultrafast推論によってワークフローやアプリケーションがどのように変革されるか、楽しみにしています。」
HNでの議論
279- iamcoder18
OpenAIとCerebrasのコラボレーションから、こんなに素晴らしいものが生まれるのをずっと待っていた。
> 我々の評価では、UltrafastモードのGPT-5.6 Solは、2,500問のHLE問題すべてに11時間11分で回答した。Claude Fable 5は同じ結論に達するのに78時間27分、つまり3日以上の連続計算を要した。言い換えれば、Ultrafastは人間の知識の最先端を1営業日で処理し、ほぼ同等の精度を約7倍の速さで達成した。
これは本当にすごい。
TerraとLunaのUltrafastリリースにも期待している。
- csallen
人々は思考の質に対する速度の重要性を過小評価している。なぜなら、質が単純な反復の結果であることを過小評価しているからだ。
LLMが考えるとき、通常は1回のパスしか行わない。トークンを上から下へ、最初から最後まで出力して、それで終わりだ。しかし人間が考えるとき、特に優れた思考家は、通常、その場で思考を反復し修正する。複数回のパスを行う。立ち止まってやり直し、再考し、見直し、再評価する。時にはこれを非常に速く自動的に行うため、自分がやっていることすら気づかないこともある。優れた知性や有能さを持つ人と他の人を分けるものの多くは、最初のパスの質というよりも、同じ時間内にどれだけ追加のパスを実行できるか、そしてもちろん、レビューのパス中に考慮する基準に何を習慣づけているかに関係していると思う。
これについて内省するのは難しいが、LLMで実験するのは簡単だ。まず、LLMに複雑なことを頼む。例えば、新しいビジネスアイデアを考え出すとか、来月の計画を立てるとか。それが終わったら、こう伝える:
「あなたが書いたものを、まず自分で考えた適切な評価基準のリストに従ってレビューしなさい。そして、その結果に基づいて、必要ならより良い回答を生成するために反復しなさい。」
次の回答が通常どれだけ良くなるかは驚くべきものだ。多くの幻覚、論理的エラー、非効率を検出して消去することがよくある[...]
- GodelNumbering
対応するOpenAIの投稿 https://openai.com/index/previewing-ultrafast/
価格情報がない。これは「値段を聞くなら...」という領域か、単に決定前に興味を測っているのかもしれない。
- Topfi
見落としていなければ、知能対速度のグラフのアニメーションは内部データのみに言及し、AAスイートを本当に再実行したかどうかは示していない。パフォーマンスの重要な側面について、実際に明確な記述はない。
CerebrasもOpenAIの投稿[0]も、これが通常の5.6 Solとまったく同じ性能であるとは明言していない。もしこれがSolと1:1で単に速いだけなら、彼らは(当然ながら)それを大々的に宣伝するだろう。「これは同じ性能で、ただ速いだけで、欠点はありません」という一文があれば、明確さとコミュニケーションに大いに役立つだろう。価格情報もないので、さらなる情報を待つことにする。
- wxw
> Artificial Analysisが報告した出力速度によると、UltrafastモードのGPT-5.6 SolはFable 5の11倍、FastモードのOpus 4.8の5倍速い。
素晴らしい仕事だ。個人的には、より高速なモデルと推論に非常に興奮している。
現在の議論では速度がある程度過小評価されていると思う。しばらくの間、私はCursorのComposerをかなり使っていた。フロンティアモデルよりも、ただもう速いという理由で。
- ricardobeat
6月にリリースされたMimo v2.5-Pro Ultraspeed(1000トークン/秒を達成可能)が比較グラフに含まれていないのは、興味深い欠陥だ。
少し古く(スコアは±40%低い)、多くのコーディングタスクには十分賢いが、コストはSolの10分の1以下だ。
- johnfn
これは確かにすごいように見えるが、驚異的なトークン処理能力は特定のボトルネックしか解決できないことを忘れてはならない。E2Eテストに1時間かかるなら、Ultracodeを使っても1時間かかる。エージェントが変更後に10分の型チェックを実行するなら、それでも10分かかる。巨大なコードベースへのgrepも同じくらい遅いままだ。これはこの成果を貶めるためではなく、14倍速いトークンがすべてのタスクを14倍速く完了するわけではないということを、皆さんに冷静に理解してもらいたいだけだ。
Humanity's Last Examはツール呼び出しなしだと思われるので、Ultrafastの速さを強調するには完璧なベンチマークだが、私たちが日常行う仕事とはあまり同じではない。
- thraway3837
これは本当にクールだ。誰かがここで、AVエンコード/デコードのハードウェア進歩との類似性についてコメントしていた。
ミニチュア化が進めば、サムネイルサイズのユーザー交換可能なアクセサリにLLMをハードウェア上に組み込むことができるようになるのは時間の問題だと思う。それがどのように機能するかはよくわからないが、体験できたら素晴らしいだろう。完全にローカルで、完全にオフラインで、あらゆるパーソナルコンピューティング製品よりも優れた超高速ローカル推論。