LLM-Intelligenz vs. Kosten: Warum die offizielle Grafik irreführt
LLMs: Intelligence vs. Cost

Der Dask-Maintainer Guido Imperiale von OpenTeams kritisiert die „Intelligence vs. Cost“-Grafik von ArtificialAnalysis. Er zeigt, dass die logarithmische Kostenskala und die offiziellen API-Preise ein verzerrtes Bild liefern. Mit eigenen Diagrammen auf Basis von OpenRouter-Preisen und Stromkosten für lokale Modelle demonstriert er, wie günstig KI tatsächlich sein kann: Modelle wie GLM-5.3-Flash sind 160-mal billiger als Top-Modelle und decken doch 90 % der Anwendungsfälle ab.
Die Kosten für den Betrieb modernster Modelle von Anthropic und OpenAI sind so hoch, dass selbst große Konzerne sie sich kaum leisten können, während chinesische Modelle so günstig sind wie ein Mobilfunkvertrag.
- oliwary
Das sieht großartig aus! Ich denke auch, dass Geschwindigkeit Teil der Metrik sein sollte (d.h. wie lange das Modell tatsächlich braucht, um eine Aufgabe zu lösen). Für mich bevorzuge ich es, teure Modelle wie Sol für leichte Denkaufgaben zu verwenden, was mir normalerweise gute Antworten mit schnellen Reaktionen gibt.
Für meinen Codierstil (schnelles Hin und Her und Korrekturen) macht es einen großen Unterschied, ob ein Modell in 1-2 Minuten antwortet oder in 5-10, und ich bin gerne bereit, dafür etwas mehr zu zahlen.
- themgt
Es gibt einen immensen Unterschied in den Kosten zwischen den State-of-the-Art-Modellen von Anthropic und OpenAI und den viel billigeren chinesischen Modellen ... Wie viel zusätzliche Intelligenz das Leeren des Geldbeutels kauft, gehorcht dem Gesetz des abnehmenden Grenznutzens: Während ein Top-Ingenieur oder -Wissenschaftler wahrscheinlich in der Lage ist zu schätzen, wie viel besser Fable 5.1 [ist] ... wird es den meisten Menschen schwerfallen, das zu tun.
Nebari ist offiziell als JATIC-Produkt gelistet, als Teil der Next-Gen-Toolchain, die die KI-Entwicklung des DoD unterstützt.
Sind wir offiziell ~einen Grad von Kevin Bacon entfernt, wenn das DoD den Einsatz von chinesischen OSS-Modellen befürwortet, weil sie selbst gehostet werden und wir alle zu dumm sind, den Unterschied zu erkennen?
https://openteams.com/open-source-isnt-the-real-risk-in-nati...
- datadrivenangel
Die Beschwerde, dass man nicht zwischen linear und logarithmisch wechseln kann, ist berechtigt, was ich auch getan habe, um eine 3D-Geschwindigkeits-/Kosten-/Qualitäts-Grenzflächen-Anwendung für einen kürzlichen Meetup-Vortrag zu erstellen: https://www.williamangel.net/apps/model_performance.html
Da Geschwindigkeit wichtig ist, da Reasoning und Hardware sowohl Kosten als auch Geschwindigkeit bestimmen, ist es ein dreidimensionaler Kompromiss.