Qwen 3.8 27B auf Cerebras: 1500 Tokens pro Sekunde
Qwen 3.8 27B available on Cerebras at 1500 tokens/s
Cerebras hat das Qwen 3.8 27B-Modell in seinen öffentlichen Endpoints aufgenommen und erreicht damit eine Inferenzgeschwindigkeit von etwa 1500 Tokens pro Sekunde. Das Modell verfügt über einen Kontext von bis zu 128k Token im kostenpflichtigen Tarif. Cerebras betont, dass alle öffentlich gehosteten Modelle unbeschnitten sind und nur selektive Weight-Quantisierung zur Speicherung verwendet wird, um die Qualität zu erhalten. Die Aktivierungen, Attention und der KV-Cache bleiben in voller Präzision.
Alle unsere öffentlichen Modelle sind unbeschnitten.
- nostrebored
Das Limit von 150k TPM am öffentlichen Endpoint bedeutet, dass es für viele Programmieraufgaben wahrscheinlich unbrauchbar ist. Als wir Cerebras in der Vergangenheit ausprobiert haben, war unser Problem immer die Raten. Wir würden gerne ohne dedizierte Instanzen auskommen und Zugang zu einem flexibleren Rate-Pool haben.
Selbst beim Ausprobieren scheint es, als wäre unser Konto in eine Art Schwebezustand geraten, in dem wir keine Zahlungsinformationen mehr hinzufügen können.
```
Billing access restricted
Self-serve billing is not available on Enterprise accounts. Please contact your team for further questions.
```
Wir haben kein Team (sie haben sich aus unserem Slack-Kanal entfernt, nachdem wir über Rate-Limits gesprochen haben). Verblüffenderweise taucht das nicht einmal in der Anfrage auf, die Folgendes liefert:
```
{"message":"Model does not exist or you do not have access to it.","type":"not_found_error","param":"model","code":"model_not_found"}
```
Obwohl der Fehler eigentlich mit der Abrechnung zu tun hat.
Ich möchte Cerebras immer mögen, aber ich habe das Gefühl, dass man als Token-Konsument überhaupt nicht wertgeschätzt wird.
- gpugreg
Ich habe mich gefragt, ob das gut zum Programmieren ist, aber es ist zu schnell für seinen eigenen Nutzen. Es gibt ein Limit von 450.000 Token pro Minute. Ich habe dieses Limit in etwa 90 Sekunden erreicht und dabei 1,10 $ verbrannt. Das liegt daran, dass gecachte Token auf das Token-Limit angerechnet werden.
Zum Vergleich: Ich habe dieselbe Aufgabe mit DeepSeek-V4-Flash ausgeführt, das in 172 Sekunden fertig war und 0,024 $ kostete, mit einer endgültigen Kontextfenstergröße von 55217 Token, während Qwen3.8-27B mit einem Kontextfenster von 64178 nicht annähernd fertig war.
Das ist eine sehr effiziente Methode, um Geld zu verbrennen, aber ich würde es nicht zum Programmieren empfehlen.
Positiv ist, dass ich einen Anmeldebonus von 5 $ bekommen habe, also war es nicht mein eigenes Geld.
- jasongill
Es wäre großartig, wenn sie ihre Inferenzkapazität für dieses Modell über OpenRouter verfügbar machen würden; der schnellste Anbieter auf OpenRouter ist derzeit bei etwa 80 tps https://openrouter.ai/qwen/qwen3.8-27b#providers
Sie scheinen andere Modelle auf OpenRouter zu hosten, also wird Qwen3.8 vielleicht bald dort sein: https://openrouter.ai/provider/cerebras
- pllbnk
Erst vor ein paar Tagen habe ich von ninfer (https://github.com/Neroued/ninfer) erfahren, und auf einer RTX 5090 kann ich jetzt etwa 200 tok/s und bei gleichzeitigen Anfragen über 400 tok/s erreichen, was für ein lokales Modell dieser Stärke völlig ausreichend ist.
- hexa00
Ich habe es gerade an einem mittelgroßen Programmier-/Debugging-Problem in einer bestehenden Codebasis ausprobiert. Beobachtungen:
- Der Input scheint nicht schneller zu sein als bei anderen Modellen, es verbringt viel Zeit mit Lesen.
Etwa 5 Millionen Token gelesen
- Der Output ist großartig, superschnell, wie man es von den 1500 t/s erwartet. Ich denke, das stimmt.
- Tool-Aufrufe schlagen häufiger fehl als zum Beispiel bei DS4, was zu Zeitverlust durch Wiederholungen führt (komplexe Tools wie Browsersteuerung zum Beispiel).
- Shell-Befehle sind immer noch ein Engpass.
Der Nettoeffekt ist, dass ich etwa gleich viel Zeit mit Warten verbringe, und ich muss den Output trotzdem lesen. Zumindest beim Programmieren versöhnt mich das mit den 100-200 t/s, die man bei DS4 oder ähnlichem bekommt. Vielleicht ist das doch ein guter Kompromiss, und schnellere t/s sind nicht der Engpass.
Außerdem macht mein Setup (OMP) den Cache vielleicht nicht richtig, aber das ist ein großer Kostentreiber ... also ist es derzeit ziemlich teuer.
- karim79
Token sind der neue neueste und größte Unsinn auf dem Planeten. Es ist amüsant. Ich kann es kaum erwarten, die Welt in 1-2 Jahren zu sehen und die Komik, wenn man auf diesen Tag zurückblickt.
- gardnr
Ich habe ihren Coding-Plan ein paar Monate lang genutzt. Es ist wirklich schwierig, mit den Modellen Schritt zu halten. Der Output ist so schnell. Qwen 3.8 27B ist wahrscheinlich eines der stärksten Modelle, die sie bisher gehostet haben.
Bearbeitung: Es sieht so aus, als wäre dies nur über API-Token-Preise verfügbar. Weiß jemand, ob sie Prompt-Caching bereits eingeführt haben? Früher wurde es für agentische Programmieraufgaben ohne Prompt-Caching ziemlich teuer.
- tacone
Mir ist aufgefallen, dass sie auf OpenRouter vertreten sind, aber Qwen 3.8 ist noch nicht dort. Hoffentlich kommt es bald.
Für diejenigen, die es noch nicht bemerkt haben: Die Kontextgröße, die sie für Qwen erlauben, beträgt nur 128k. Immer noch interessant als spezialisierter Sub-Agent, aber nicht wirklich geeignet für lange Aufgaben.