OpenRouter: Warum dasselbe Modell je nach Anbieter völlig anders abschneidet

So you want to use OpenRouter?

OpenRouter bündelt über 20 Anbieter für dasselbe Modell, doch die Leistung unterscheidet sich drastisch: DeepSeek V4 Flash erreicht bei DeepSeek selbst 90 % GPQA und 81 % TAU, bei DigitalOcean nur 75 % und 58 %. Der Betreiber von Olly, einem iMessage-Assistenten mit über 18 Millionen Nachrichten, zeigt anhand von zehn Fallstricken, warum man Anbieter nach Benchmarks auswählen sollte – nicht nach Quantisierung oder festen Präferenzen.

Wenn du `deepseek/deepseek-v4-flash` anforderst, bekommst du eine von etwa 20 Firmen, von denen du die meisten noch nie gehört hast. Auf dem Papier sind es dieselben Modelle, im echten Leben sehr unterschiedliche.
  1. joshstrange

    Das deckt sich mit meiner, viel viel kleineren, OpenRouter-Nutzung. Es ist einfach unglaublich unzuverlässig und man ist gezwungen, Provider festzunageln, und selbst dann kann es ein Glücksspiel sein, wie der Autor festgestellt hat.

    OpenRouter verkauft die Idee, dass der Wechsel zwischen Anbietern eine Commodity sei, aber nichts könnte weiter von der Wahrheit entfernt sein. Anbieter A ist oft nicht gegen B oder C austauschbar (wieder, wie dieser Autor festgestellt hat). Das kann einen wahnsinnig machen, wenn man dasitzt und denkt: „OpenRouter hat doch gar keine Kleider an, oder?! Bin ich derjenige, der sich irrt?“.

    Ich liebe die _Idee_ von OpenRouter und vielleicht kann Stripe diese Situation verbessern, aber die einzige vernünftige Art, es zu nutzen, die ich gefunden habe, ist, Provider so eng festzunageln, dass ich mich frage, ob ich nicht einfach die Provider direkt nutzen sollte.

    Ohne Festnageln erwartet einen eine Welt voller Schmerz und Unzuverlässigkeit (unterschiedliche Modellfähigkeiten, Geschwindigkeit usw.).

  2. jmward01

    Ja zu all dem, aber noch mehr. Was mich dazu gebracht hat, zu gehen und zu einem einzigen Anbieter zu wechseln, war Token-Caching. Ich muss ständig Provider blockieren, die nicht richtig cachen. Ich sehe, wie die Leistung einbricht, schaue dann in die Logs und ein neuer Provider wurde hereingerotiert und jeder Aufruf an ihn ist ungecacht, weil er offensichtlich kaputt ist. Das ist jetzt schon ein paar Mal passiert und zerstört im Wesentlichen die Kosteneinsparungen (diese Provider haben auch oft eine schreckliche Qualität). Überwachen die nicht simple Dinge wie das? Ihre eigenen Logs zeigen, wie klar dieses Muster bei manchen Providern ist. Einfache Cache-%-Statistiken würden es ihnen ermöglichen, Provider fast sofort zu blockieren.

  3. cesarvarela

    Das habe ich bei DeepSeek Flash und DigitalOcean bemerkt. Die machen etwas ernsthaft falsch, wenn sie dieses Modell ausliefern; wir brauchen so etwas wie ein SLA, aber für Intelligenz; das ist fast betrügerisches Verhalten.

  4. vova_hn2

    > Dasselbe Modell wird sehr unterschiedlich abschneiden

    Provider servieren wahrscheinlich quantisierte Versionen, ohne es offenzulegen. Was wirklich schade ist, denn für bestimmte Aufgaben wäre ich durchaus bereit, Genauigkeit gegen Kosten zu tauschen. Aber leider ist es unmöglich, explizit zu wählen, wie quantisiert das Modell sein soll, es sei denn, man betreibt es selbst auf eigener (oder gemieteter) Hardware.

    Übrigens, weiß jemand, ob LLM Gateway unter denselben Problemen leidet? Ich schaue mir gerade an, es auszuprobieren, bin aber noch nicht dazu gekommen.

  5. neya

    Das Beste an OpenRouter ist, dass 200 OK wahrscheinlich fest in ihre Antworten einprogrammiert ist.

    Ich bekam ständig content: "" und habe dreimal meinen Code überprüft, um zu sehen, ob ich etwas falsch mache, bis mir klar wurde, dass die meisten KI-Anbieter im Allgemeinen ihre Infrastruktur auch nur zusammengevibecodet haben und es einfach ein vergeblicher Versuch ist, dagegen anzukämpfen.

  6. rolfus

    Das sind sehr nützliche Informationen und sie kommen genau zum richtigen Zeitpunkt! Ich nutze Openrouter für meinen neu veröffentlichten Lauf-Tracker (ich verwende es für Live-Coaching und Debriefings nach dem Lauf). Ich habe im Laufe der Zeit eine Reihe von Modellen gebenchmarkt, um ihre Eignung für diese spezifische Aufgabe zu bewerten, und habe festgestellt, dass ein Modell manchmal scheinbar ohne Grund schlechter abschneidet. Ich werde ab jetzt sicherlich Modell-Provider in meine Benchmarking-Suite aufnehmen!

  7. memoryleakgame

    <Rant>

    Ich arbeite seit Monaten an einem Produkt und bin für eines der spezifischen Modelle der Nummer-3-Nutzer geworden und sehr wahrscheinlich bald der Nummer-2.

    Es ist ein Google-Modell. Die Edge Cases sind verrückt zu handhaben und haben lange gebraucht, um sie zu finden. Ich stelle auch fest, dass ich, da es keine Fallbacks, aber kein veröffentlichtes Rate Limit gibt, im Alleingang das Modell mit einer Menge an Anfragen lahmlege, die ich für vernünftig hielt. Es gibt keinen anderen Fallback, der nicht Google ist. Ich mache mir Sorgen wegen der anhaltenden Nutzung durch meine Nutzer beim Launch in ein paar Tagen. Offensichtlich kann Google damit nicht so viel Geld verdienen, wenn ich etwa 10 % der Nutzung ausmache und der Top-2-3-Nutzer bin, der mehrere Hundert pro Monat für Tests vor dem Launch ausgibt.

    Warum sollten sie sich also darum kümmern, einem kleinen Startup zu helfen? Ich werde irgendwann zu einem kosteneffizienteren anderen Modell wechseln und all die Fußangeln wieder neu finden müssen.

    Ich bin mir nicht sicher, worauf ich damit hinauswill, aber ich wollte es einfach andere wissen lassen

    </rant>

  8. fzysingularity

    Die Kommentare des Autors zu Vision-Providern sind besonders interessant. Wir haben gesehen, dass die meisten Provider keine native Video-URL-Unterstützung bieten und eine hohe Variabilität in der Vision-Leistung aufweisen (wahrscheinlich aufgrund der Tatsache, dass sie unterschiedliche Quantisierungsstufen hinter derselben Modell-ID ausliefern).

    Wenn man Vision-native Apps baut, gibt es so viele Fußangeln in vLLM/SGLang-Serving-Konfigurationen, ganz zu schweigen vom Routing/der Orchestrierung bei Providern wie OR, dass der Nutzer danach mehr verwirrt über die Fähigkeiten des Modells ist.

Mehr von diesem Tag

2026-09-11