Qwen 3.8 27BがCerebrasで毎秒1500トークンを達成

Qwen 3.8 27B available on Cerebras at 1500 tokens/s

Cerebrasの公開エンドポイントで、Qwen 3.8 27Bモデルが毎秒約1500トークンの推論速度で利用可能になりました。このモデルは64k(無料)または128k(有料)のコンテキスト長をサポートし、27億パラメータを備えています。Cerebrasは、公開モデルはすべて枝刈りされておらず、品質を保つために選択的な重み量子化のみをストレージ時に適用していると説明しています。REAPなどの枝刈り研究はHugging Faceで公開されていますが、APIでは提供されていません。

Cerebrasは、公開エンドポイントで提供するすべてのモデルは元の枝刈りされていないバージョンであり、品質を維持するために選択的な重み量子化のみをストレージ時に適用していると述べています。
  1. nostrebored

    公開エンドポイントの150k TPM制限は、多くのコーディングタスクにはおそらく使えないことを意味します。過去にCerebrasを試したとき、私たちの問題は常にレートでした。専用サーバーを扱わずに、もっと柔軟なレートプールにアクセスできればと思います。

    試してみたところ、アカウントが請求情報を追加できないリンボ状態に移されたようです。

    ```

    Billing access restricted

    Self-serve billing is not available on Enterprise accounts. Please contact your team for further questions.

    ```

    私たちにはチームがありません(レート制限について話し合った後、彼らはSlackチャンネルから自分たちを削除しました)。不可解なことに、これらはリクエストには一切表示されず、次のようなエラーが返ります:

    ```

    {"message":"Model does not exist or you do not have access to it.","type":"not_found_error","param":"model","code":"model_not_found"}

    ```

    実際の問題は請求に関するものなのに。

    私はいつもCerebrasを好きになりたいと思っていますが、トークンを入出力する消費者としては、あなたはまったく評価されていないという雰囲気を感じます。

  2. gpugreg

    これがプログラミングに使えるかどうか疑問に思っていましたが、速すぎて逆に問題です。毎分450,000トークンの制限があります。この制限に約90秒で達し、その間に1.10ドルを消費しました。これはキャッシュされたトークンがトークン制限にカウントされるためです。

    比較として、同じタスクをDeepSeek-V4-Flashで実行したところ、172秒で完了し、最終的なコンテキストウィンドウサイズは55,217トークンで、コストは0.024ドルでした。一方、Qwen3.8-27Bは64,178のコンテキストウィンドウでまだ完了に遠く及んでいませんでした。

    これはお金を燃やす非常に効率的な方法ですが、プログラミングにはお勧めしません。

    良い面としては、5ドルのサインアップボーナスをもらったので、自分のお金ではありませんでした。

  3. jasongill

    このモデルの推論容量をOpenRouter経由で利用できるようにしてくれれば素晴らしいのですが、現在OpenRouterで最速のプロバイダーは約80tpsです https://openrouter.ai/qwen/qwen3.8-27b#providers

    彼らはOpenRouterで他のモデルもホストしているようなので、Qwen3.8もすぐにそこに登場するかもしれません: https://openrouter.ai/provider/cerebras

  4. pllbnk

    ちょうど数日前にninfer(https://github.com/Neroued/ninfer)について知り、RTX 5090で現在約200トークン/秒、同時リクエストでは400トークン/秒以上を得られるようになりました。これはこの強さのローカルモデルにとっては十分に速いです。

  5. hexa00

    既存のコードベースで中規模のコーディング/デバッグ問題を試してみました。観察結果:

    - 入力は他のモデルより速く見えません。読むのに多くの時間を費やします。約5Mトークンを読みました。

    - 出力は素晴らしく、1500トークン/秒から期待される通り超高速です。それは正しいと思います。

    - ツール呼び出しは、例えばDS4よりも失敗することが多く、リトライに時間を浪費します(ブラウザ制御のような複雑なツールなど)。

    - シェルコマンドも依然としてボトルネックです。

    正味の効果として、待ち時間はほぼ同じで、出力も読む必要があるため、少なくともコーディングに関しては、DS4などで得られる100〜200トークン/秒にむしろ納得させられます。もしかするとそれが結局良いバランス点であり、より速いトークン/秒はボトルネックではないのかもしれません。

    また、私のセットアップ(OMP)がキャッシュを正しく行っていない可能性もありますが、それが大きなコスト要因です... 現時点ではかなり高価です。

  6. karim79

    トークンは地球上で最新かつ最高の無意味なものだ。面白い。1〜2年後の世界を見て、この日を振り返って笑うのが待ちきれない。

  7. gardnr

    私は数ヶ月間彼らのコーディングプランを使用しました。モデルに追いつくのは本当に難しいです。出力がとても速い。Qwen 3.8 27Bはおそらく彼らがこれまでにホストした中で最も強力なモデルの一つでしょう。

    編集:これはAPIトークン価格でのみ利用可能なようです。プロンプトキャッシングを展開したかどうか誰か知っていますか?プロンプトキャッシングなしでは、エージェント型コーディングタスクにはかなり高額になることがありました。

  8. tacone

    彼らがOpenRouterに存在することに気づきましたが、Qwen 3.8はまだそこにはありません。すぐにそこに登場することを願っています。

    気づいていない人のために言うと、彼らがQwenに許可するコンテキストサイズはわずか128kです。専門のサブエージェントとしてはまだ興味深いですが、長いタスクにはあまり適していません。

この日のほかの記事

2026-09-03