11のAIモデルを同一プロンプトで比較、クレジット消費は最大で400倍以上の差
Choosing an AI model: one prompt, 11 models, different results

NetlifyがOpenRouterとの提携を発表し、AI GatewayとAgent Runnersで利用できるモデルが拡大。Kimi K3、GLM 5.2、DeepSeek V4などの最新オープンモデルが追加された。本記事では、同一プロンプトで11モデルをテストし、生成されたサイトの見た目とクレジット消費を比較。コーヒーショップの静的サイト生成で、Claude Opus 5は平均519クレジット(最大1,055)を消費したのに対し、DeepSeek V4 Flashは平均2.4クレジットと、実に200倍以上の差がついた。高価なモデルが必ずしも優れた結果を生むとは限らず、モデルごとに異なる「見た目」のトレードオフが明らかになった。
クレジット消費の平均はClaude Opus 5が519、DeepSeek V4 Flashが2.4と、実に200倍以上の開きがある。
HNでの議論
95- Systemerror7A69
私の考えが間違っているかもしれませんが、こうした評価は興味深いものの、本格的な開発に携わっている人にとってはあまり意味がないのではないでしょうか?
私がそう思うのは、個人的にAIを使う際は、具体的で詳細な指示を与え、プロジェクトを少しずつ構築していくからです。
私は低レベルのコードをほとんど見ず、その一部は理解したいと思うほどには理解していませんが、単純な2文のプロンプトよりもはるかに技術的な指示を与えています。
したがって、この「単純なプロンプトからのワンショット」評価は、実際のアプリケーションをまったく代表していないため、モデル評価自体に関してはかなり無意味に思えます。
これはどちらかというと「バイブコーダー」、つまりプログラミングのバックグラウンドがほとんどない人がウェブサイトを欲しがる場合のためのものではないでしょうか?
- isqueiros
> 近所のコーヒーショップの1ページサイトを作成する:営業時間、住所、短いメニュー、写真。私が自分で編集しない限り、何も変更されません。
それがプロンプト全体だとすると、これらがすべてどれほど似ているかはかなり憂鬱です。Opus 5バージョンの詳細のいくつかは評価しますが、そのデザインから漂うAIの雰囲気を強く感じずにはいられません。
- jwr
私は長い間、スパムフィルタリングの目的で多数のローカルモデルを使って多くのベンチマークを行ってきました。主な観察結果は、モデルのパフォーマンスには大きなばらつきがあるということです。これは驚くべきことではありません。これらは乱数に基づく確率的な機械であり、実行ごとにパフォーマンスが変わるからです。しかし、これはまた、サンプルサイズ1のベンチマーク評価は、モデル比較の目的には本質的に価値がないことを意味します。
私のベンチマークでは、少なくとも5回の実行を要求し始めました。
これはまた、モデルを比較する投稿されたベンチマークのいくつかに対して非常に疑念を抱かせます。結果にベンチマークの実行回数とばらつきが記載されていなければ、比較の根拠は本当にありません。あなたはただ推測しているだけです。
- arjie
今日では、アドホックな評価を構築するのは簡単です。そして、出力間の曖昧さを排除するためにLLMジャッジを前に置くことができます。例えば、私はFrigateをビデオフィードのゲートとして使用し、LLMが自宅のカメラを監視できるようにしています。ラベリングタスクには数分かかり、評価はかなり低コストで実行されます。https://wiki.roshangeorge.dev/w/images/4/4e/Screenshot_-_Eva...
これは、一般的なベンチマークや評価は時代遅れであることを意味します。「コーヒーショップのページを作って」などと書かせる必要はありません。代わりに、実際の問題に焦点を当て、それがその問題を解決するかどうかを評価してください。価格性能フロンティアに沿って移動したいだけで、SOTAモデルは間違いなくパフォーマンス曲線の頂点にありますが、非常に高価なので、ゴールドスタンダードを生成し判断するのに非常に役立ちます。
以前から今日への変化は、ベンチマーク最大化とトークンごとの価格設定が評価ポイントを同じ方向に向けていることです:結果を代理しないでください。代わりに、統計的に信頼できる判別が得られるまで、最高のモデルを他のモデルのジャッジとして展開し、タスク固有のフロンティアに沿って移動してください。
- sinuhe69
記事をざっと読んだところ、モバイルデバイス向けのデザインをテストしていないと思いました。なぜなら、そのことが言及されていなかったからです。それは大きな間違いでしょう。今日のウェブデザインでは、モバイルファーストのアプローチが必須です。これは、カフェを紹介したい場合にはさらに重要です。
Firefoxの開発者ツールを使って、このデザインがモバイルデバイスでどのように動作するかを確認しました。大きな違いがあります。
一部のデザインは画面スペースを非常に非効率的に使用しており、電話ではタイトルと大きな退屈な一般的なグラフィックだけが表示されます。ユーザーはコンテンツを見て必要なものを見つけるために、ずっと下までスクロールしなければなりません。より良いデザインは、メニュー、ナビゲーションポイント、意味のある美的なグラフィックを表示します。Gemini 3.6などの他のデザインはかなり洗練されていますが、トラフィックに最適化されておらず、3G接続では読み込まれません。しかし、単純な静的ウェブサイトはモバイル接続で即座に読み込まれるべきです。
とはいえ、単純なウェブページでも多くの要件があるため、ユーザーがプロセスを導いていない場合に、ターンキーで既製のデザインを期待するのは現実的ではありません。したがって、今日の最良の選択は、優れたデザインスキルを持ち、反復的なデザインプロセスを理解して遵守し、優れた初期デザインを出発点として提供するだけでなく、ユーザーにガイダンスとフィードバックを提供するよう促すモデルだと思います。デザインプロセスが多くのサイクルを経るにつれて、初期コストは控えめであるべきです。しかし、さらに重要なのは、モデルが自身のデザインを理解し、その選択を説明できることです。そうすれば、[...]