トークンは安すぎて計測不能に——AIのコストが桁違いに下落
Tokens Too Cheap to Meter

機械学習の利用コストは年々数桁単位で下落し、その勢いは衰えていない。GPUの電力効率は2年ごとに倍増し、モデルはタスクあたりのコストが2025年から2026年にかけて2桁安くなった。推論エンジンの改善やMixture-of-Experts、Mambaアーキテクチャにより、同じ品質をより少ない計算資源で実現できるようになっている。さらに、Jevのような特殊な分類器は出力トークンを無料にし、LLMをインフラとしてあらゆる計算に統合する未来が現実味を帯びている。
Input tokens: $0.042 / MTok ($42 per billion tokens). Output tokens: FREE (too cheap to meter).
HNでの議論
134- jetrink
> トークンはツール呼び出しより安くなる
著者はGPT-5.6 Lunaの呼び出しがgrepよりわずか4〜5桁高いだけだと指摘し、現在の進歩率ならLLMの呼び出しはまもなくgrepより安くなると予測している。ここでスタインの法則を引用する良い機会だと思う。「永遠に続かないものは、いずれ止まる」。こうした効率改善は永遠には続かない。むしろ、grepのような高品質でコンパイルされたソフトウェアの呼び出しあたりのコストが下限となり、LLMはそこに漸近していく可能性の方が高い。永続的な指数関数的進歩でその線を吹き飛ばすというよりは。(量子コンピューティングや室温超伝導体のような真のブレイクスルーがない限りは。)
- meatmanek
どこでも見かけるArtificial Analysisのチャートについて、ちょっと愚痴らせてほしい。
「最も魅力的な象限」は完全に無意味だ。パレート曲線の要点は、曲線上の各点が少なくとも1つの次元で他のすべてより優れており、異なる指標の相対的な重要度に価値判断を下すことなく比較できることにある。2つの指標の合成スコア(任意の単調非減少関数、例えば非負の重み付き和)を作れば、そのスコアは常にパレートフロンティア上の点のいずれかで最大化される。
だからTFAの2番目のチャート(最初のAAチャート)の数値だけを見ても:
- Deepseek V4 Pro 0813 (max) が「最も魅力的な象限」にあるからといって選ぶ理由はない。GLM-5.3-Flashの方が安く、スコアも良い。
- 右上のClaude Fable 5.1 (max with fallback) は、最高スコアのモデルが必要でコストを気にしないなら、たとえ「最も魅力的な象限」になくても最も魅力的な選択肢になり得る。
- チャートの左側に表示されていないモデルは、安いトークンが大量に必要で品質を気にしないなら、最も魅力的な選択肢になり得る。
(もちろん、チャートに表れていない他の要素をスコアに含めれば、違う選択をするかもしれない。)
* ラベルの配置も気に入らないし、ラベルと点を結ぶ灰色の線はあまりに目立たなすぎる。
- cs702
OPは洞察に富んでいて読む価値があると思った。HNで共有してくれてありがとう。
OPが十分に分析していない唯一の側面は、ビジネスモデルの実現可能性だ。すべてのプレイヤーは、将来の利益がその投資を正当化すると期待して、狂気じみた額をインフラに投資している。AGI競争の勝者(あるいは勝者たち)は、いわゆる「虹の先の金の壺」を見つけると信じている。
OPはビジネスモデルの実現可能性の問題を、簡単な定性的な議論とほとんどハードデータなしで gloss over している。例えば、インフラに投じた1兆ドルごとに年率10%超のリターンを得るには、そのインフラの所有者は年間1000億ドルを超えるフリーキャッシュフロー(営業利益から投資を引いたもの)を永久に稼がなければならない。それは実現可能なのか?なぜ?どうやって?
OPはそうした疑問を本当には考慮していない。
- abirch
「計測不能なほど安い」は1954年の原子力発電の約束を思い出させる。
「我々の子供たちが家庭で計測不能なほど安い電力を享受することを期待するのは、過剰ではない…」ルイス・ストラウス
https://en.wikipedia.org/wiki/Too_cheap_to_meter#Origins
奇妙なことに、私の電気料金は計測されていて、しかも高かった。
- leoc
LLMが「ローカル」でありたがっているのは事実だが、メーカーから十分な量のVRAM(あるいは少なくとも「統合」メモリ)が供給されるまで、広くローカルに移行することはない。(ここでは、政府によるローカルモデルの禁止のような抜本的な規制変更は起きないと仮定している。)なので(私の見る限り——専門家ではないが)、今後数年間のLLMの未来は、主にどれだけのメモリ製造能力がいつ追加されるかという細かい話にかかっており、より小さな程度で、LLM SaaSサービスからの将来の需要(そして彼らがトラブルに陥った場合の既存ハードウェア在庫)がどうなるかにもかかっている。(また、近い将来のフロンティアモデルを今日の準フロンティアモデルよりはるかに価値あるものにするような、ほぼAGI規模の飛躍はないと仮定している。)既存メーカーにとって高マージン事業はVRAMを効率的に使うLLM SaaSプロバイダーへの販売だが、高ボリューム事業はVRAMを非常に非効率に使う何百万台ものラップトップにチップを届けることだ。彼らは物理的な能力を構築してより高いボリュームを出荷するにつれて、高マージンから高ボリュームへ移行したいと思うだろうが、悠然としたペースでやることを好むようだ。中国の競合他社からの揺さぶり、そしておそらくデータセンターからの需要減少が、物事を加速させることを願う。
- foob
タスクあたりの価格下落について、はるかに深い分析が昨日Epoch AIによって発表された[1]。これは本物の統計分析であり、より防御可能で根拠のある結論に達している。見出しの要点は:
特定の性能レベルが最初に達成された直後、つまりそれが最先端(SOTA)であるときに、その性能レベルのコストはしばしば最も速く下落する。我々はAI能力の5つの主要ベンチマークのうち3つでこのパターンを見ている。5つすべてを平均すると、SOTAとしてデビューしたばかりの性能ではコストは四半期ごとに66%下落する(年間75倍)。2年後には、価格の下落は半分の速さになり、四半期ごとに32%(年間4.7倍)となる。
しかし分析自体はよりニュアンスに富み、非常に興味深い読み物だ。
[1] https://epoch.ai/publications/the-plunging-price-of-thought
- bryanlarsen
> NVIDIAは依然としてブームだろう
NvidiaはAnthropic/OpenAIと同じ圧力下にあると思う。Nvidiaは研究を支配し、おそらくトレーニングも支配し続けるだろうが、本当のボリュームは推論にある。そして推論においてNvidiaのリードはわずか数ヶ月であり、フロンティアラボがオープンソースに対して持つリードと同程度だ。NvidiaはRubin CPXを大量に売るだろうが、そのマージンはB200よりもずっと小さくなる。なぜならその分野にはるかに多くの競争があるからだ。
- npilk
2025年と2026年のコスト比較に誤りがあるようだ。2025年のチャートの軸は「インテリジェンス指数」全体を実行するコストであり、2026年版はタスクあたりの加重平均コストだ。
ここでの主張に反対はしないが、コストがそれほど急速に下がっているとは思わない。