Warum 1 Million Tokens zwischen $0.09 und $290.12 kosten können
$0.09 and $290.12 are both the price of 1M output tokens
Ich habe untersucht, warum die Kosten für Inference so extrem variieren. Die Analyse zeigt, dass die Wahl des Modells kaum eine Rolle spielt. Stattdessen entscheiden Faktoren wie die Auswahl des Accelerators, der Provider, die Concurrency-Konfiguration und vor allem die Auslastung über den Preis. Selbst bei Self-Hosting gibt es eine harte Obergrenze, die eine Kosteneinsparung unmöglich machen kann.
Wenn Sie Anbieter pro Token vergleichen, während Ihr Reasoning-Effort auf hoch eingestellt ist, optimieren Sie den kleinsten Term in der Gleichung.