Fireworks' Ember-1 liefert Kimi-K3-Qualität mit 40 % weniger Tokens

Fireworks Research hat Ember-1 vorgestellt, ein auf Kimi K3 basierendes Modell, das dessen Qualität mit 40 % weniger Tokens erreicht. Durch mehr als 50 Trainingsläufe lernte es, überflüssiges Reasoning zu reduzieren, ohne die Genauigkeit zu verlieren. In Live-A/B-Tests mit Produktions-Workloads sank der Tokenverbrauch um etwa 35 % bei vergleichbarer Qualität. Ember-1 setzt zudem eine neue Pareto-Grenze auf Doximitys Bedside Bench und schlägt GPT-5.6 Sol, GPT-6 Astra und Claude Opus 5 bei den Kosten pro Aufgabe.
Die kosteneffizienteste Art, K3 auszuführen, besteht nicht mehr darin, es weniger denken zu lassen, sondern Ember-1 zu verwenden – das Modell, das gelernt hat, effizient zu denken.
- GodelNumbering
Das ist das goldene Zeitalter des Modelltrainings. Vor ein paar Tagen habe ich beschlossen, dass ich ein lokales, nur auf der CPU laufendes Modell möchte, das bei der Übersetzung von Englisch nach Bash außergewöhnlich gut abschneidet (um das Googeln nach Befehlssyntax zu vermeiden). Ich habe eine Reihe von Subagenten dazu gebracht, eine große Menge an Trainingsdaten zu generieren (über 140.000 Beispiele), habe das Qwen 3 0.6B-Basismodell genommen, Astra darauf angesetzt und los ging's. Es trainierte zwei Tage lang (mit Unterbrechungen) und ich bekam ein überraschend gutes Modell für meine Aufgabe! Die insgesamt aktiv verbrachte Zeit betrug ein paar Stunden. Und es wird immer noch besser – was für eine Zeit, um am Leben zu sein!
- tukHelix
Es ist das erste Mal, dass ich erfahre, dass Fireworks ein Team für Modellforschung hat. Ich habe da gemischte Gefühle. Einerseits freue ich mich immer über Verbesserungen von OSS-Modellen, sei es bei der Intelligenz oder der Kosteneffizienz. Andererseits wäre ich etwas besorgt, Fireworks als meinen API-Anbieter zu nutzen. Bis zu dem Moment, als ich diese Nachricht sah, hatte ich Fireworks als meinen Anbieter für deepseek v4 flash genutzt, weil ich dachte, dass Fireworks in der Rolle, OSS-Modelle bereitzustellen und Rechenressourcen zu verkaufen, sicher zu nutzen sei, ohne Sorge, dass Daten zum Training verwendet werden, da es keinen „Interessenkonflikt“ gibt. Aber jetzt würde ich zweimal darüber nachdenken.
- netvarun
Off topic: Mit dem Preisverfall von sol ist der Wertbeitrag von kimi k3 ehrlich gesagt nicht mehr so groß. Für unseren internen Anwendungsfall/Tests/Benchmarks schneidet sol mit deutlich besserer Qualität und viel geringeren Kosten ab.
Kimi muss wirklich seine Preise senken (ich habe gehört, sie werden von ihnen für alle Neoclouds festgelegt).
Sol liegt bei 2/10 gegenüber Kimis 3/15
- nxtfari
Je mehr ich über Fireworks lerne, desto unsympathischer erscheinen sie mir als Unternehmen. Es ist mir egal, was die Lizenz sagt: Moonshot hat offen Verbesserungen vorangetrieben, Forschung geteilt und Gewichte für die Modelle bereitgestellt, die eure gesamte Bilanz ausmachen, und in dem Moment, in dem ihr sie im Gegenzug verbessern könnt, sind es geschlossene Gewichte, „das ist unser eigenes proprietäres“ Unsinn? Wo sind wir, dass China eine bessere Open-Source-Ethik hat als Amerika?
- jamienk
Mal abgesehen von der Frage, was als „offen“ zählt: Werden offene Modelle durch so etwas nicht so rasant voranschreiten, dass die proprietären das kaum noch können? Genau so haben Linux und Wikipedia beispielsweise ihre „Frontiers“ überholt, oder?
- Arcuru
Drüben auf /r/LocalLLaMA gibt es eine Gruppe, die populär geworden ist und dasselbe für die Qwen 27B (und andere) Modelle macht. - https://huggingface.co/ukisai
- tangled
Was übersehe ich hier? Ich denke bei Fireworks an einen Inferenzanbieter, der Modelle mit offenen Gewichten bereitstellt. Der Wert, den sie Kunden hauptsächlich bieten, ist, dass sie (i) die Zuverlässigkeit verbessern, indem sie über eine Reihe von Clouds/Neoclouds hinweg balancieren, (ii) bessere Preise erzielen, indem sie Kapazität in großen Mengen einkaufen, und (iii) die Betriebskosten senken. So weit, so gut.
Ich kann auch das Argument für einen Post-Training-Service aus der Perspektive der Kundengewinnung nachvollziehen: „Hey, wir können dieses Modell mit offenen Gewichten feinabstimmen, sodass es sowohl bessere/vorhersehbarere Ergebnisse liefert als OpenAI/Anthropic als auch günstiger ist. Und übrigens, sobald wir dich als Kunden gewonnen haben, lass dieses Modell bitte auf unserer Infrastruktur laufen.“
Aber was ich schwer verstehe, ist, dass Fireworks eine Menge Geld (für Gehälter und Compute) ausgibt, um ein Frontier-Modell zu veröffentlichen, das schnell hinter die Frontier zurückfallen wird. Ist das „nur“ Werbung für sie, sowohl für Kunden als auch für die Personalbeschaffung? Oder versuchen sie tatsächlich, an der Frontier zu bleiben? Wenn ja, zu welchem Zweck?
- soerxpso
Ich sehe nicht, warum ich an diesem Modell interessiert sein sollte, wenn man den Preisunterschied bedenkt. Sie werben damit, dass es dasselbe ist wie Kimi K3 bei halb so vielen Tokens. Aber der Preis ist doppelt so hoch wie der von K3. Warum sollte es mich also kümmern, wenn es weniger Tokens verbraucht, wenn ich doppelt so viel pro Token zahle?