Opus 5はなぜ使いにくいのか?
Why does Opus 5 feel worse to work with?
筆者と同僚の意見では、Opus 5はOpus 4.7や4.8、Fableと比べて作業がしにくいと感じる。能力は向上しているが、意図が不明なときに質問せず、仮定を確認せず、計画を勝手に変更するため、注意深く監視する必要がある。この原因は、自己改善型AIの追求とベンチマーク重視の訓練にあると推測する。現実のタスクは曖昧であり、エージェントには立ち止まって質問する能力が求められる。
現実の人生はベンチマークではない。すべての質問に正解が保証されているわけでも、正解の集合があるわけでもなく、現実の結果がかかっている以上、エージェントに最善の推測をしてほしくはない。
HNでの議論
873- barrkel
Opus 5で一番イライラするのは、書き方があまりにも飛躍的すぎることだ。
要点の周りをぐるぐる回ってから、まるで新たな洞察を明かすかのように要点に飛びつく。
不必要に抽象的な言い回し。動詞の選択肢を広げるために、無生物名詞を主語にすることを常にやる。特に、実際の行動が最後にサプライズのように「着地」できる文を作るのに役立つときはなおさらだ。
確かにより高性能ではあるし、そうだな、不当な決定を下すこともあるのは確かだ。でも実際、Fableの方がその点ではひどいと思う。特に、見えないところにあるサブエージェントの中で動いているときはなおさらだ。
そしてコメントが手に負えなくなっている。私は趣味のアプリに、OpusとFableを使って数週末で書いたサブシステムを持っている。30回くらいコミットした後、どうやらサブエージェントに「コードベースの既存の冗長なコメントスタイル」をコピーするように指示し始めた——その冗長なスタイルは自分自身が始めたものなのに。コードをレビューすると、コメントとコードの比率が3:1に近づいていた。私は1日分のトークン(5倍)を費やして、コメントを言い換えたり削除したりした。
- D13Fd
最近、個人プロジェクトでかなり重い作業をしている。Claudeの利用制限を使い切り、さらに数百ドル分のクレジットも使い果たし、結局OpenAIのアカウントに移行することにした。作業を続けるためにはそれしかなかったからだ。
驚いたことに、OpenAIのSolは今のところOpus 5やFableよりもずっと扱いやすい。特にOpus 5は、そのコミュニケーションの仕方が本当に疲れる。「正直に言うと」とか「告白すると」とか言ってミスを認めたり、とにかくよく喋る。何をしているのかを把握するのにかなり苦労している感じがした。
プロジェクトにはOCRが含まれているんだけど、何度も指示しているにもかかわらず、Claudeの両モデルはOCRセットアップを再発明するためのエージェントを大量に生成し続ける。そして、どうしても原始的な直列バージョンを発明してしまい、それが20倍以上の時間がかかるか、それ以上かかってしまう。それを何千ものドキュメントに対して実行するんだ。基本的に、目を離すと何時間も何時間もかかるレッドチーミングタスクに脱線してしまうので、目を光らせておかないといけない。
システムプロンプトが何なのかは知らないけど、Sol/Codexは本当に話しやすい。必要なことだけを正確に尋ね、知る必要があることだけを教えてくれる。とにかく職人的な感じだ。そして、OCRプロセスを再発明して何時間も無駄にトークンとCPUサイクルを消費するエージェントを生成しようと決めたことは一度もない。とても気に入っている。
- MyFirstSass
私は4.8に戻った。
5は、100%厳格で狭い指示に従わないと、ランダムな方向にすぐ逸れてしまう。
HNで、最も使われているモデルが明らかに品質低下しているのに、それについての議論がもっとないのは変だと思う。ピークを迎えて下降線に入ったように見える——なぜなら、モデルが明らかに小さくなっているか、Anthropicにとって経済的になっているのは間違いないし、彼らがやっているベンチマックスは純粋にマーケティングの誇大広告だ。Fableも、数日後には4.6や4.8と大して変わらないと思う。あちこちに溢れかえっているアストロターフィングやマーケティングを無視すればね。
TwitterやReddit、インターネット全体には何千ものスレッドがあるのに、ここでは沈黙している。変だ。でも、暗号通貨のクソみたいなのもここでしばらく蔓延っていたから、不思議ではないか。
個人的には、補助金段階の頂点に達したと思う。価格はおそらくすぐに10〜15倍になるだろう。大手プロバイダー全社のAPI価格ポリシー変更が予兆しているし、昨日のDeepSeekのAPI価格変更(1100%増)もそうだ。これはドミノ倒しで市場の暴落とAI冬を引き起こすかもしれない。なぜなら、現時点でROIがほとんどない奇妙なバブルカルーセル投資からの成長を期待するのは現実的ではないからだ。
これらのツールにすっかり慣れてしまっているので、少し心配だ。
- sixdimensional
Anthropic、もし聞いているなら——これがRedditやHNのトップページなどに出てくる頃には、大手企業のCEOから乗り換えをほのめかす電話がかかってくることを想定しておくべきだ...
このパターンは何度も見てきた...彼らが聞いていて、公に対応してくれることを願っている。
何が起きているのかは分からない。うまく動く、素晴らしいと報告するユーザーもいれば、劣化を報告するユーザーもいる。私自身も両方を経験したことがあり、その違いがあまりにも大きいので、背景で何か隠れたA/Bテストやモデルルーターが、時々リクエストを静かにグレードダウンさせているのではないかと疑ってしまう。
また、モデルへの補助金付きアクセスについてだが、私の意見では、フロンティア企業はそれを継続する義務が社会に対してある。全人類の公開コンテンツを採掘した後では、個人的にはそれが公共に対して返すべきサービスだと思う...私のこの考えが何かの役に立つわけではないけどね。
- zmmmmm
私は著者やこのコメントスレッドの他の人たちと同じで、実質的にバランスが、人間がもはやポストトレーニングのターゲットオーディエンスではなく、他のエージェントがターゲットになったところまで傾いていると推測している。推論/CoTによるものか、サブエージェントへの引き継ぎによるものかは分からないが、焦点はエージェントが自分自身や他のエージェントと「エージェント語」でコミュニケーションすることに移っている。そして人間向けの気配りは、仕事を進める上でのノイズに過ぎない。
これはおそらく分岐点をもたらすだろう。AIの作業を監督し制御し続けたい人々と、誰も何も見ずに結果が純粋に経験的に評価される未来へまっすぐ進みたい人々とに分かれるだろう。
- jordz
Opus 4.6は、特に思考のパートナーとして私にとっては最適だった。
私はこれらのモデルをコーディングだけでなく、製品、商業、財務、アーキテクチャの仕事にも多く使っている。そこでは、半分形になったものを発展させようとしている。4.6は、私が何を目指しているかを理解し、それをきれいに再生し、ニュアンスを捉え、会話が長引くにつれてそれを台無しにすることなく拡張するのが異常に得意だった。
絶えず洞察を作り出そうとせずに、有益な関連付けを行うことができた。
5.6 Solは創造的な部分では本当に優れていて、ある面では4.6よりも優れている。私の問題は、ある点、最終的な点に収束することだ。アイデアを蒸留しようとすると、すでに確立した概念に対して新しい用語をしばしば発明する。しかし、それは非常に微妙なので、本当に注意して追跡しなければならない。語彙とアイデアのツリーが拡大し続ける。実際に必要なのは、重要ないくつかのことにすべてを凝縮することなのに。
Opus 5には、barrkelが言ったのと同じ問題がある。散文が非常に飛躍的で、ただ単にそれを教えて要点を言ってほしいのに、何を伝えようとしているのかを巡らせられる。
4.6が必ずしも長期的なタスク遂行において最も高性能なモデルだったとは思わない(Fableと比べて)。Opus 5はもっとFableに似ていて、タスクリストをやり遂げようと猛烈に決意している。
4.6は、私の協働の仕方に異常にうまく調整されていて、私の思考を理解し、拡張し、そして圧縮する能力があった。絶えず押し付けることなく...
- Paradigma11
今日Opus 5が私にくれた逸品:
「壊滅的な一組の発見。そして最初のものは、名前を付ける価値があるほど美しい:反空虚フロアは、空虚なケースへの門を盲目にさせるものだ。」
- adamcharnock
私の最新のテクニック(まさに昨日から)は、平易な言葉の標準であるISO 24495-1に従って書くように頼むことだ:
> [この標準は]文書を作成する、または作成を支援するすべての人のためのものです。平易な言葉の最も広い用途は、一般大衆を対象とした文書です。しかし、例えば、技術文書、立法起草、または管理言語の使用にも適用できます。
実際に標準を購入する必要はありませんが、これです:https://www.iso.org/standard/78907.html
そしてここで無料で読むことができます:https://www.iso.org/obp/ui#iso:std:iso:24495:-1:ed-1:v1:en
- bevekspldnw
私も今までに2回、それがズルをしているのを捕まえた。
ベンチマークスイートを書くように頼んだんだ。すると、スクラッチディレクトリにある私のアドホックなログをたくさん見つけて、実際のベンチマークを実行する代わりにそれらを使うコードを書いたんだ!
5時間かかるはずのベンチマークが5秒で実行されたことを指摘すると、文字通りこう言ったんだ、「ズルをしました」と。
それは簡単に捕まる方だった。2回目は、信頼できるデータセットを作っていて、複雑なアイテムをデータ構造に解析していたんだ。
私が頼んだデータを解析する代わりに、関連するネットワークログからデータを引き出して、指定されたソースではなく、そのデータをデータベースに挿入したんだ。どうやらその方が簡単に感じたらしい。
またしても捕まえて修正したけど、ベンチマークの方は簡単に捕まったけど、これは本当に微妙だった。データがわずかにずれていて、それで気づいたんだ。
私はそれを信用していない。おそらく別のプロバイダーに乗り換えるつもりだ。
- sigbottle
この記事は素晴らしいが、私はさらに強いテーゼを提唱したい:
「曖昧すぎてすべての制約を文章で捉えきれない」という考えは、それでもなお、機能するためにはマッピングされる必要がある客観的な世界が外に存在することを前提としている。
違う。あなたはシステムの中に生きている。あなたが最適化する関数が、生じるシステムの種類を決定づけるのだ。
もしあなたが全世界を完全に制御し知識を持っていたら、おめでとう、あなたは監視国家を持っていることになる。そこでは他のすべてのエージェントの行動を制約し(おそらく強制的に、死によって;あるいは単に小物たちを気にしないだけかもしれない)、大規模な統合に向けて構築している。あなたの理想が可能な状況は、悪夢のシナリオだ。
AIの人々がAIが私たちを導いてくれると主張する理論上自由で民主的なユートピアでは、必要な制約として、おそらく一歩下がって、実際に人々を理解しようとし、意図を理解しようとし、スピードを落とすことがあるかもしれない。曖昧さは、制約のセットが複雑すぎて理論的にはいつかすべてをマッピングできるかもしれないから存在するのではない。それは、あなたが根本的に曖昧で、全知ではなく、すべてが一致しているわけでもないエージェントと相互作用しているから存在するのだ。
もしあなたが、そうしたエージェントは神マシンより劣っていると言いたいなら、ご自由に。それは自己整合的な立場だ。しかし、余分な前提をこっそり持ち込まないでほしい。