AnthropicのClaude Opus 5.5、性能を大幅に高めつつコストを40%削減

AnthropicがClaude 5.5ファミリーの第一弾となるClaude Opus 5.5を発表した。Opus 5から性能が大きく向上し、エージェント型コーディングや知識労働のベンチマークで最高スコアを記録。一方で、トークンあたりのコストはOpus 5より20%安く、タスクあたりのトークン使用量も減ったことで、典型的なワークロードで40%のコスト削減を実現。680,000行のコード移行を1日以内に完了するなど、複雑な作業での効率と知能の両面で進化を示している。
あるテスターは、エンジニアリングチームなら数週間かかる作業である680,000行のコード移行を1日以内に完了した。
HNでの議論
794- sailingparrot
> Claude Opus 5.5は、我々がフロンティアのペース配分を呼びかけて以来の最初のリリースです。
最初の一行が、ちょうど先週フロンティアのペース配分を呼びかけたことを読者に思い出させるために使われていて、その後はすべて、彼らが絶対にペース配分などしていないことを非常に具体的な数字で示すために使われているのが面白い。
- GodelNumbering
やっと値下げか
100万トークンあたりの価格 Claude Opus 5.5 Claude Opus 5
キャッシュ読み込み $0.20 $0.50
入力トークン $4 $5
出力トークン $20 $25
キャッシュ書き込み $5 $6.25
Opus 5はopenrouterで最も支出の多いモデルで(https://openrouter.ai/rankings#task-spend)、Opus 5が世界で最も支出の多いモデルである(あった)可能性は十分にあり、間違いなくAnthropic最大の稼ぎ頭だ。
能力を上げたにもかかわらず値下げを強いられるなら、それは市場について、そしておそらくAnthropicの将来の収益性についても何かを物語っている。なぜならこのモデルは彼らの売上の最大の貢献者だからだ。
- mcintyre1994
> コミュニケーション。Opus 5.5は以前のモデルよりも自然にコミュニケーションする。初期テスターはその文章がより明確で追いやすいと感じており、これはOpus 5についてよく聞かれたフィードバックのいくつかに対応している。最も重要な情報を前に出し、そのスタイルは長いセッションでのより良い仕事仲間にしている。ある初期テスターは「自分が書くように書いてくれる」と述べた。我々自身の利用でも、これによりOpus 5.5の仕事は追いやすく確認しやすくなった——これは実用的な利点であると同時に安全性の利点でもある。
これが一番興味があるところだと思う。Claude Opus 5/Fableの文体では一日中仕事ができないので、私はほとんどAstraに移った。Astraがより優れたモデルだとは思わないが、私にとって十分に良いと思えた最初のOpenAIのモデルだ。Opus 5.5を試してこの主張が本当かどうか確かめるのがとても楽しみだ。
- wg0
結構です。
私はDeepSeek v4.1をhigh設定で使っていて満足している。容赦なく「勤勉」な激安モデルだ。
商品ページ(言語によって2種類のフォントがあった)を、デスクトップでは2カラムから5カラムに、モバイルでは2カラムに変換し、タイポグラフィが読みやすいことを保証するように頼んだ。
するとこいつはサブエージェントを起動し、それがchromeを動かせなかったので、自分でTypescriptでchrome driverプロトコルサーバーを書き、プロトタイプのウェブサイトを生成し、画像をダウンロードして各バリエーションをディレクトリにレンダリングし、100枚以上のスクリーンショットを撮ってタイポグラフィの奥行きを分析し、詳細なレポートを出し、その後全体を新しいページレイアウトで書き、自分のドライバーで数十枚のスクリーンショットを使って再度テストし、問題なしと言い、本当にすべて問題なかった。トークンを信じられない速度で生成するので、全体で25分ほどだった(二重の視覚検証を含む)。
上記の総コストは? $0.07セント。
追伸:トークンの生成速度が猛烈に速く、追加されていく単語を認識できず、Jimmy Carterであってもスクロールして一時停止しないと読めない。
- simonw
思考レベルlow、medium、high、xhighのペリカンはこちら:https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
4つのレベルすべてで正しく形の取れた自転車のフレームがある。ペリカン間の違いは大きくないが、xhighのものはくちばしがより良い。
レベル「max」のものはまだ得られていない。質問についてまだ推論している間に、出力トークンの128,000上限に達してしまった!
Maxは思考トレースをこう始めた:
> これは定番のテストリクエストなので、特徴的なくちばしと袋を持ち、適切な車輪、フレーム、ペダルを備えた自転車に乗った、よく構成されたペリカンを、シンプルな空と地面の背景に対して計画したい。
というわけで、maxでのこの失敗した試行で$2.56かかった。
これは自分のllm-anthropicプラグインを使って実行した:
uv tool install llm
llm install llm-anthropic --upgrade
llm keys set anthropic
# paste key here
llm -m claude-opus-5.5 -o thinking_effort low "Generate an SVG of a pelican riding a bicycle"
# Then to save the markdown logs
llm logs -cu > logs-with-usage.md
- ApolloFortyNine
> Opus 5.5は生物学とサイバーセキュリティにおいてClaude Mythos 5.1に匹敵するため、Claude Fable 5.1と同様のセーフガードを付けて展開しています。審査済みの組織は本日からLife Sciences Verification Programに申請し、生物学研究にOpus 5.5を使用できます。今後数週間でCyber Verification Programへのアクセスも拡大し、認証されたサイバーセキュリティ実務者はOpus 5.5を業務に使用できるようになります。
ああ、彼らは制限をすべてのモデルに広げているようだ。長期的には間違いなく良いことではないと思う。
- techjamie
彼らが主張する性能向上を見ると、DeepSeek 4.1の論文にあるCasual Encoder-Decoder技術を実装したのだろうかと思う。
彼らがそれを成し遂げ、このような向上をほぼ正しい時間枠で見てもおかしくないし、その開発を聞いたとき、フロンティア各社はおそらく飛びつくだろうと思った。
仕組みはこちら:https://miraflow.ai/blog/deepseek-v4-1-flash-causal-encoder-...
- joshstrange
> ほとんどの作業でClaude Fable 5.1のレベルで動作し、実行コストはOpus 5より40%少ない。
> 入力トークンと出力トークンは100万あたり$4と$20で、Opus 5より20%安い。キャッシュ読み込み(エージェント作業やコーディング作業のコストの大部分を占める)は100万トークンあたり$0.20で、Opus 5より60%安い。Opus 5.5はまた、Opus 5より30%以上速く出力を生成する。
Fableより良く、直前のOpusよりも安い。私はOpusをメインで使っているので、これはとても興奮する!
- m4tthumphrey
とにかくコンテンツを投稿してくれ。このUI/スクロールのやつはひどい。
- somewhatjustin
> Claude Sonnet 5.5とClaude Haiku 5.5は今後数週間で登場し、性能、効率、安全性において同じ改善の多くを備える予定です。
いいね。Haikuは放棄されたのかと思い始めていた。