予算別に最適なLLMが一目でわかる、毎日更新の価値フロンティア

Best LLM for every budget, updated daily

Artificial Analysisの知能指数とAPIのブレンド価格を突き合わせ、価格帯ごとに最も賢いモデルを毎日自動更新で提示するサイト。価格上昇に対してスコアが改善しない「支配された」モデルを可視化し、$8以上ならClaude Opus 5.5、$0.23未満ならGPT-6 Lunaなど、予算に応じた最適解と次点が表で確認できる。

予算が該当する行を見つければ、その価格で得られる最高スコアのモデルが選定され、次点は同じく予算内に収まる次に優れたモデルです。
  1. ford

    Artificial Analysisに直接行ったほうがいいよ。これは機能が貧弱で、誤解を招く、時代遅れの再パッケージにすぎない。

    例えば、この手の価格推定はかなりナイーブだ。同じ知能レベルに到達するのに2〜3倍のトークン数を必要とするモデルもある。Artificial Analysis自身のタスクあたりコストのほうが、より公平なコスト推定だ。

  2. Xeoncross

    24〜64GBのMacを持っているなら、夜間にQwen3.8 27Bをローカルで走らせることを検討してみてはどうだろう。ローカル実行は少し遅いが、寝ている間なら問題は少ない。

    メモリ量によっては、より弱いQ4バージョンを使う必要があるが、それでも性能は十分だ。

    GPT-5.3 Codex (xhigh)やClaude Opus 4.6 (max)よりも上位にランクされているので、https://github.com/kunchenguid/gnhf と組み合わせて夜間の実験やクリーンアップ、朝のための推薦リスト作成に最適だ。

  3. Brendinooo

    もっとサブスクリプション料金に焦点を当てたものが本当に欲しい。

    来月LLMに100ドル使いたいなら、何をすべきか?Opus 5.5/Fable 5.1が高スコアだからClaudeを選ぶ?4.7が能力とコストのバランスが良いらしいからGrokを選ぶ?中国製モデルを試す?それともこのサイトが言うように、サブスクは一切やらない?

  4. jrflo

    実際に自腹でAPIコストを払っている人なんているのか?CodexやChatGPTのサブスクを取るほうが10倍安い。APIに比べてあまりにも手厚く補助されているから、deepseek flashにAPI価格を払うより、フロンティアモデルをサブスクプランで使うほうが安いに違いない。

  5. greggh

    M1 Max 32GBのMacBookでQwen3.8 27Bの量子化/チューニング版を走らせている。それに良いpiのセットアップを組み合わせると素晴らしい結果が出ている。以前はモデルの完全なq8を使ったこともあるが、遅さ以外に実際の違いは見られない。でも一晩中タスクを走らせておくのはうまく機能している。現在、ネイティブMacのSwiftアプリケーションのいくつかの問題をデバッグしていて、問題リストを順調に片付けている。

    32GBで自分にうまく機能しているのはこれだ:

    https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

    具体的にはこれ:Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf

  6. Tepix

    1. 現実には、私たちのほとんどはOpenCode Goなどのトークンパッケージを使っている。

    このサイトのように、さまざまなプランを考慮し、選択したモデルの月額料金あたりのトークン数を計算しようとするサイトがあると便利だ。これが作業をずっと難しくすることはわかっている。

    2. 人々が所有しているAIハードウェア向けに、そのようなチャートがあると便利だ。どのモデルを走らせるかを決めるのに役立つ(結果として知能と速度のレベルが変わる)。これも全員を満足させるのは難しく(例えば前処理とトークン生成)、最新の状態に保つのも難しい!

    昨日 https://llm-list.com/ を見つけて、詳しく見てみたら、すぐに古い項目が見つかった。例えばGLM 5.3 flashを見ると、もはや無料ではないプロバイダーがいくつか「無料」と記載されていた。

  7. floppyd

    時間が経つにつれて、モデルの能力をたった1つか2つの数値だけで区別するのは難しくなるばかりだ。もっと客観的でない属性、例えば冗長さ、諦めやすさ、コード内の私が思いつかなかった、あるいは話すことすら思いつかなかったような潜在的な問題を「先読み」して事前に解決する能力などに基づいて、すべてのモデルを多次元的に配置したものを見てみたい。

    例えば、私はDeepseek v4.1 Flashをとても楽しんでいる。時にはほとんど馬鹿げているように思えるほど「率直」だが、絶対に諦めず、どんなに非効率な解決策でもほとんどどんな問題でも解決してしまう。

    それをどう測定すればいいのか全くわからない。タスクあたりの平均CoT長は、あるものには良い近似になるだろうが、そうでないものもある。

  8. qwerty2020

    トークンあたりのコストはコストを指標化する極めてナイーブな方法であり、このチャートを本質的に無意味にしている。

この日のほかの記事

2026-09-24