Das Ende der AI-Subventionen: Warum Flat-Rate-Modelle scheitern

The current AI pricing was always going to go away

Das Ende der AI-Subventionen: Warum Flat-Rate-Modelle scheitern

Die Ära der AI-Subventionen ist vorbei. Flat-Rate-Modelle brechen, weil induzierte Nachfrage und explodierende Hardwarekosten für HBM und GPUs die Rechnung sprengen. Unternehmen wie Microsoft und GitHub passen sich an, während Labs wie Anthropic unter Wasser liegen. Der Fokus muss sich von 'wo AI hinzufügen?' auf 'welche Use Cases rechtfertigen die Kosten?' verlagern, was neue Preismodelle wie Pay-per-Action oder Credits erfordert.

Jede neue Fähigkeit erfindet neue Nachfrage; billigere Inferenz senkt nicht die Rechnung, sie erweitert nur, was Menschen dem Modell abverlangen.
  1. PiRho3141

    Hier kommt die Bedeutung von Open-Source-Modellen ins Spiel.

    Das neueste DeepSeek v4 Pro-Modell ist 2- bis 5-mal günstiger als Claude Sonnet 4.6. Cursor's Compose 2.5, das erst kürzlich veröffentlicht wurde, ist 6-mal günstiger als Sonnet.

    Die State-of-the-Art-Modelle werden besser und teurer werden, während kleinere Modelle günstiger werden.

    Es wird einen Punkt geben, an dem die Intelligenz sowohl der günstigen als auch der State-of-the-Art-Modelle für Menschen nicht mehr unterscheidbar ist, so wie ich den Unterschied zwischen Terrance Tao und meinem Universitätsmathematikprofessor nicht verstehen kann.

    Ich brauche nicht immer die intelligentesten und teuersten Modelle. Ich werde sie gelegentlich benötigen und diesen Preis gerne zahlen, wenn es sein muss. Was ich brauche, ist das Modell, das mein aktuelles Problem in angemessener Zeit löst.

  2. _fat_santa

    Ich frage mich, wie viel von Ubers Verschwendung ihres AI-Budgets und MSFTs Rückzug von ihren Claude-Code-Lizenzen auf "Tokenmaxxing" zurückzuführen ist.

    Als Meta Token-Ranglisten ankündigte und andere nachfolgten, konnte ich sehen, dass dies die logische Konsequenz sein würde. Der ganze Trend ist so dumm, weil er genau dazu führt.

    Ein Unternehmen kündigt an, die Leistung der Entwickler daran zu messen, wie viele Token sie verbrennen, und spricht ständig darüber, wie die besten Entwickler die meisten Token verbrennen. Die Entwickler sehen die Botschaft und fangen an, Token zu verbrennen. Und dann tut sich das Unternehmen überrascht, als die Rechnungen in die Höhe schießen.

    Ich persönlich nutze mein OpenAI-Abonnement ziemlich intensiv, mit 2-3 Agenten, die praktisch den ganzen Tag über verschiedene Aufgaben laufen, aber ich komme nie annähernd an meine Limits, während ich von anderen höre, die in derselben Zeit die Limits auf mehreren Konten sprengen. Ich bin überzeugt, dass die meisten dieser Leute und ihre aufwendigen Workflows nicht wirklich der Produktivität dienen, sondern dem Prahlrecht darüber, wie viel sie AI nutzen.

  3. tekacs

    > Anthropics CFO sagte im März unter Eid aus, dass das Unternehmen 10 Milliarden Dollar für Compute ausgegeben und 5 Milliarden Dollar Umsatz erzielt hat (Ed Zitron hat die Mathematik dazu). Die Labs liegen bei der Inferenz unter Wasser. Sie erhöhen die Preise, um die Lichter brennen zu lassen.

    Es ist absurd zu sagen, 'Die Labs liegen bei der Inferenz unter Wasser', ohne die Kosten für _Compute_ in Training und Inferenz zu trennen.

  4. extr

    Wovon spricht der OP eigentlich? Die Kosten pro Einheit Intelligenz sinken rapide. Man kann das erreichen, was 2022 als Wunder betrachtet worden wäre, für weniger als 10 Dollar.

  5. abtinf

    Soweit ich das beurteilen kann, ist die Inferenz auf einem Weg, der sie zu "kostenlos" werden lässt. Die Modelle sind jetzt auf High-End-Consumer-Hardware extrem leistungsstark, und der Effizienztrend wird wahrscheinlich anhalten.

    Hier ist ein kürzlich durchgeführter, nicht ganz rigoroser Benchmark, den ich gegen eine Reihe von Modellen durchgeführt habe. Qwen3.6 35B A3B, feinabgestimmt mit Opus-Daten, läuft auf meinem lokalen Rechner schnell genug und liefert hervorragende Ergebnisse – leicht in den Top 5, vergleichbar mit GPT 5.5 Pro (das 180 Dollar/mtok kostet).

    https://gistpreview.github.io/?31d66ef69e4aed3efae1aec69d86c...

    Ich sage seit Jahren voraus, dass die Industrie den Weg der Virenscanner-Anbieter einschlagen wird: Abonnements verkaufen, um die neuesten Versionen der Modelle herunterladen zu können. Ich sehe einfach nicht, wie ein anderes Geschäftsmodell außer auf dem allerhöchsten Niveau der Inferenz oder der Videoerstellung auch nur entfernt tragfähig sein könnte.

Mehr von diesem Tag

2026-07-07