10のモデルとハーネスの組み合わせを同じThree.jsタスクでテストした結果
I tested 10 model/harness combinations on the same Three.js task
同じThree.jsプロンプト(SF格納庫のシーン生成)を10のモデル/ハーネス組み合わせで実行し、成功率、生成時間、トークン使用量、ツールエラーなどを比較。Codex、OMP、OpenCode、DSHなどのハーネスと、GLM 5.3 Flash Max、Luna 5.6 Max、SOL 5.6 Max、Astra 6.0 Max、Qwen 3.8 27Bなどのモデルを組み合わせた。結果は、OpenCode + GLM 5.3 Flash Maxが最高の成功率(96.89%)を記録し、Codex + Astra 6.0 Maxが最も長い時間(37分)を要した。
同じプロンプトでも、モデルとハーネスの組み合わせによって成功率は78.54%から96.89%まで大きく変動した。
HNでの議論
59- onion2k
Astraバージョンは2024年10月のthree.js r170を使っているようだ。Solはさらに古いバージョンを使っていた。GLMのコードは最新版を使っているが、jsdelivrからthree.js@latestを取得しているだけなので、そのバージョンに対してコードを書いているとは考えにくい。OpenCode上のQwenもjsdelivrから取得しているが、r160に固定されたバージョンを使っている。
これらの例はどれもトーンマッピングなどを使用していないので、sRGBのまま(AgXやACESの方がずっと見栄えが良い)、ノードマテリアルも使っていない(プログラムによるテクスチャ実装に良い)、シャドウ環境のベイクやポストプロセッシングエフェクトのようなクールなこともしていない。
これらは素晴らしいが、AIモデルがこの種のプロジェクトでどれだけ遅れているかを示しているのであって、どれだけ優れているかを示しているわけではないと思う。
- utopiah
実行日を特定した各モデルの推定コストの列があれば良かったのに。
理想的には、テストを実行する前に公開されているものを何らかの方法で見つけられれば(正しい方法が何かはわからないが)。特定のトピックに関して、js13kのようなコンペティション、書籍からのライブコード例、テンプレートなどがあれば、結果はかなり異なるだろう。視覚的には、結果は非常に似ていて、短いながらも比較的説明的なプロンプトの結果なのか、それとも常に何らかのテンプレートが見つかってそれに依存した結果なのか、疑問に思わずにはいられない。
- alvins82
ところで、私の優れたデスクトップ用codex/claudeのようなアプリの探求において - https://github.com/openchamber/openchamber - これが最有力のようだ。私はこれをOMPと組み合わせて https://github.com/alvins82/omp-openchamber-server/ を使っている。
オープンモデル用の強力なGUI+ハーネスセットアップが欲しかったので、新しいモデルが出るたびに使ってテストできるようにしたかった。
- poilcn
良いね。しかし、これらのテストは、どの結果が再現可能なのか、最終的なビジュアルなのか、時間なのか、ツール呼び出しなのか、それともほとんどノイズなのか、という疑問を提起する。例えば、同じ組み合わせやモデルとハーネスを複数回試したことはあるか?
- rao-v
小さな選択が結果を良くも悪くもするのが本当に興味深い。AstraとGLMの1つは明るいライトを追加していて、そのおかげで私の目にはずっと良く見えた。
Qwen 3.8の結果のいくつかには純粋に満足している(特にそのモデルをQ8で実行できるので)。
ハーネスとしてのPi (OMP)がOpencodeよりどれだけ優れているか(このタスクでは)を見るのは興味深い。
判断が簡単で主観的でない結果をもっと見たい。
私は、楽しく見られるバトルシミュレーターを作るおもちゃのプロジェクトを進めている。そこでは、LLM(対戦プレイなら2つ)が、互いに調整して戦う複数のボット(それぞれ独自の視界と限られたバトルコンテキストを持つ)を制御するプログラムを書かなければならない。目標は、LLMが現在の状況に基づいてコードを5分間のシミュレーションバトル中に5〜10回更新することだ。ボットが新しいプログラミングを要求できるようにし、再プログラミングのステップ数に基づいてスコアリングすることも探求している。