Cerebras CS-4発表:GPU比30倍高速な推論を実現する新アーキテクチャ

Cerebrasが新製品CS-4を発表。3つのWSE-3 Turboを搭載し、GPUと比較して最大30倍高速な推論を実現します。電力効率も向上し、10兆パラメータを超えるモデルで毎秒1,000トークン以上の生成が可能です。モジュール式のラックスケール設計により、導入時間を日単位から時間単位に短縮し、ハイパースケールデータセンターへの展開を容易にします。
CS-4は、GPUシステムと比較して最大30倍高速な推論を実現し、本番環境で利用可能な最速の推論速度という新記録を打ち立てます。
HNでの議論
273- KronisLV
神様、どうか彼らがその主張を裏付けるために、Kimi K3とGLM 5.3のサブスクリプションを提供してくれますように。時代遅れのGLM 4.7インスタンスではなく、それをプレビューモデルと呼んで削除すると言い、ユーザーには今やほぼ役に立たないGPT-OSS 120Bだけを残すなんて: https://support.cerebras.net/articles/9996007307-cerebras-co... と https://www.cerebras.ai/pricing
どうやら彼らは今、一般の開発者には関心がなく、ハードウェア販売に集中しているようだ。
- syntaxing
この件で面白いのは、GPT 5.4はおそらくアクティブパラメータ45Bで、GPT 5.6 Solは50Bに近いということだ。
- bearjaws
今週、CerebrasがGPT-OSS-120b以外の何かを本番環境で立ち上げるのを見たかった。特にGLM4.7が廃止されるというのに。
もしQwen 27bやDeepseek Flashを立ち上げてくれたら素晴らしいのに。
- sreekanth850
AMDとCerebrasが近い将来、NVIDIAの独占に対抗できるかもしれない。また、NVIDIAには複数の企業からの競争があるだろう。これは単なる私の予測だ。
- reilly3000
> CS-4は10兆パラメータを超えるモデルで毎秒1,000トークン以上を実現
おっと、彼らはGPT-5.6 Solのパラメータ数を漏らしたのか?
- 9cb14c1ec0
皆さんに注意喚起ですが、LLM向けに最適化されたハードウェアはまだ数世代、数年しか経っていません。今後5年間で速度やコストが桁違いに改善されることを期待すべきです。そうすれば、「無制限」の「知能」や、平均的なChatGPTユーザーが会社に月10セントしかコストをかけない場合の消費者向けAI製品の価格競争や利益率について、楽しい議論ができるでしょう。
> CS-4は10兆パラメータを超えるモデルで毎秒1,000トークン以上を実現
すごい!
- xmorse
Cerebrasは非常に高速だが、希少性のせいで基本的に使うことはほとんどできない。
- ethanzhang1024
もしCerebrasが好調なら、なぜその前身であるサーバーS-3が、公式モデルリリースを凌駕してOpenRouterで最大のAPIトークンプロバイダーにならなかったのか?