9つのコーディングハーネスをローカルLLMで走らせたら、待ち時間が226秒になった話
Nine coding harnesses vs. your laptop

M4 MacBook Pro上でQwen 3.8 27Bを動かし、9つのコーディングハーネスを比較した。システムプロンプトとツールスキーマの合計が18,046トークンに達するopencodeでは、最初の応答まで225.7秒かかり、コンテキストの44%しか作業に使えない。一方、最小限の設計のchadは25.6秒で応答し、24タスク全てに合格。ローカル環境ではハーネスの設計思想が性能を大きく左右する。
あなたのラップトップはクライアントでありサーバーでもある。最良の場合、これらのサイドリクエストはローカルモデルをキューに待たせる。最悪の場合、繰り返し長いプリフィルを引き起こす。
HNでの議論
54- OleksandrC
リソースが制約された環境(ノートPC、小さなVPSサーバー、小型のシングルボードコンピュータなど)にうまく収まり、ローカルモデルでも快適に動作するコーディングエージェントをお探しなら、hax(https://usehax.dev/)も気に入るかもしれません。0.7 MBの動的リンクされたネイティブCバイナリで、実行時のRAM使用量は数MB、実行中のローカルllama-serverから設定を自動検出し、コンテキスト使用量を抑えるために最小限のシステムプロンプトとツールを使います。
- julesrms
HNではエージェントハーネスのベンチマークが次々と流れてくるようですね。そして毎回思うのですが、こうしたテストを作る人たちは、どのハーネスをテストするか決めるときにどこを見ているのでしょうか?というのも、今のところ誰も私のもの(https://juggler.studio)をテストしようとしないのです!
Jugglerが非常に新しいのは分かっていますが、この分野は変化が激しすぎて、どこに注力すべきか分かりにくいです。Jugglerの強みがこのような特定のテストでうまく発揮されるのか、それとも悪く見えるのか、推測するのは難しいです。人々がどんなパラメータに関心があるかについてのフィードバックは、何を最適化するか決める上で役立つ情報です。
- alex_john_m
これはどういう意味ですか?
「夜の間に最大50%まで広がるので、リーンアーム間の差は所見とは言えない」
- toasty228
少し話がそれますが、私はローカルモデルを使っていないので、最近自分のワークロードでcodexとpiとompをベンチマークしたところ、codexはpi/ompよりも速く、トークン効率も良いことが分かりました。piが速い、あるいは安いケースは一つもありませんでした。
- larodi
多くの人がローカル推論にQwen 3.8 27BをApple Siliconでもx86でも使っているというパターンが見えます。これは、これら多くの人の意見が一致していることから、このモデルが非常に優れているに違いないことを示唆しています。