为何 Opus 5 用起来反而更糟?

Why does Opus 5 feel worse to work with?

在我看来,与 Opus 4.7、Opus 4.8 和 Fable 相比,使用 Opus 5 的体验反而像是倒退。尽管它在基准测试中表现更强,但其他模型更懂协作:它们会在意图不明时主动提问,不会盲目假设,也不会擅自修改计划。Opus 5 却需要我时刻盯着,生怕它自作主张。我认为这源于 Anthropic 等实验室的两股压力:一是追求能自我进化的 AGI/ASI,二是死磕基准测试分数。为了在封闭任务中拿高分,模型被训练成在模糊情境下大胆猜测,却牺牲了现实中我们最需要的‘停下来确认’。毕竟,现实生活不是基准测试,没有标准答案,更容不得 AI 随意下注。

现实生活不是基准测试,没有每个问题都有保证正确的答案,甚至没有一组正确答案,而现实后果摆在眼前,我不希望代理随意猜测!
  1. barrkel

    Opus 5 最大的 annoyance 在于它写得太过简略晦涩。

    句子绕着重点转圈,然后突然跳出来,仿佛那是某种顿悟。

    不必要的抽象措辞。它总是习惯用无生命的名词做主语,以此来解锁动词的多样性,尤其是当这能帮它构建一个句子,让真正的动作像惊喜一样在句尾“落地”时。

    它的能力确实更强,是的,我也发现它会做出一些不该做的决定,但实际上我发现 Fable 在这方面更糟,特别是当它派出的子代理(subagent)在视线之外乱跑的时候。

    而且注释也完全失控了。我在业余项目里用 Opus + Fable 花了好几个周末写了一个子系统。大概提交了 30 次之后,它似乎开始指示子代理去复制“代码库现有的冗长注释风格”——而那种冗长风格正是它自己发起的。检查代码后发现,注释与代码的比例接近 3:1。我花了一天的 token 量(是平时的 5 倍)去重写和删除注释。

  2. sigbottle

    这篇文章很棒,但我想提出一个更激进的观点:

    那种认为“因为太模糊而无法在文本中捕捉所有约束”的想法,仍然预设了外部存在一个客观世界,我们需要将其映射才能运作。

    不,你就生活在系统内部。你所优化的那些函数,将决定会涌现出什么样的系统。

    如果你拥有对整个世界完美的控制和认知,好吧,恭喜,你建立了一个监控国家,你限制了所有其他代理的行为(可能是通过死亡强制限制,或者你根本不在乎那些小人物),并走向了大规模整合。你的理想得以实现的情境,其实是噩梦场景。

    在 AI 从业者声称 AI 能带我们抵达的那个理论上自由、民主、乌托邦的世界里,一个必要的约束是:也许你应该退一步,真正尝试去理解人、理解意图,并慢下来。模糊性的存在,并不是因为约束集太复杂以至于理论上总有一天能全部映射下来,而是因为你本质上是在与那些本身就很模糊、全知全能、并未完全对齐的代理互动。

    如果你只想说那些代理劣于“上帝机器”,请便。这是一个自洽的立场。但别偷偷塞进额外的前提。

  3. D13Fd

    最近我在一个个人项目上投入了大量精力。我把 Claude 的额度用光了,又花了好几百美元的积分,最终决定转到 OpenAI 账号,只是为了能继续干活。

    令我惊讶的是,OpenAI Sol 目前用起来比 Opus 5 或 Fable 舒服得多。尤其是 Opus 5,它的沟通方式简直让人精疲力竭。它一直在“保持诚实”、“承认错误”,总之就是废话连篇。我觉得必须深挖才能看清它在做什么。

    这个项目涉及 OCR,尽管我反复指示不要,但两个 Claude 模型还是不断生成一堆代理去重新发明 OCR 设置,而且它们似乎总会发明出一个原始的串行版本,完成时间要长 20 倍甚至更久,然后还要对成千上万份文档运行它。基本上我必须像鹰一样盯着它,否则它就会在红队测试(red-teaming)任务上空转好几个小时。

    我不知道它的系统提示词是什么,但 Sol/Codex 就是好沟通得多。它只问真正需要的东西,只告诉我需要知道的信息,而且总体上非常干练。它一次都没有决定去生成一个代理,花几个小时毫无意义地燃烧 token 和 CPU 周期去重新发明 OCR 流程。我真的挺喜欢它的。

  4. sixdimensional

    Anthropic,如果你在看——等到这事儿在 Reddit、HN 首页等处发酵时……你们应该准备好接听各大公司 CEO 的电话了,他们可能会威胁弃船而去……

    我们以前见过这种模式好几次了……希望他们能听进去并公开回应。

    我不确定发生了什么,有些用户报告说运行良好甚至很棒,另一些则报告说性能下降。我也两种情况都遇到过,体验差异之大让我怀疑后台是不是有什么隐藏的 A/B 测试或模型路由,在某些时候悄悄降级了请求。

    另外,关于模型的补贴访问,在我看来,前沿公司有义务继续提供这种服务。在挖掘了全人类的所有公开内容之后,我个人觉得这是他们回馈社会的一种服务……当然,我的这种感觉可能不算数。

  5. MyFirstSass

    我已经回退到 4.8 了。

    如果不是基于 100% 严格且狭窄的指令,5 版本总会不断跑偏到随机方向。

    我觉得很奇怪,HN 上竟然没有更多讨论:目前使用最广泛的模型质量明显下降,似乎我们达到了顶峰,现在正走下坡路——毫无疑问,该模型显然更小或更经济,而他们做的基准测试(benchmaxxing)纯属营销噱头——在我看来,Fable 在几天后也没比 4.6 或 4.8 好多少,尽管到处都有疯狂的虚假宣传和营销。

    推特、Reddit 和整个互联网上有成千上万的帖子,但这里却一片死寂。很奇怪,但也难怪,毕竟加密货币的垃圾话在这里也猖獗过一阵子。

    我个人认为我们已经到了补贴阶段的顶峰,价格很快可能会上涨 10-15 倍,正如所有大提供商的 API 价格政策变化所预示的那样,再加上昨天 DeepSeek API 价格暴涨 1100%,这可能会引发多米诺骨牌效应,导致市场崩盘和 AI 寒冬,因为指望从这种 bizarre 的泡沫轮盘赌投资中获得增长(目前 ROI 很低)根本不可行。

    对此有点担心,毕竟我已经很习惯这些工具了。

  6. jordz

    对我来说,Opus 4.6 是作为思维伙伴的最佳平衡点。

    我用这些模型来写代码,但也大量用于产品、商业、财务和架构工作,在这些场景中我正试图开发一些尚未成型的想法。4.6 在理解我的意图、清晰地反馈、捕捉细微差别,以及在对话拉长时扩展想法而不扭曲原意方面,表现异常出色。

    它能建立有用的联系,而不会不断试图制造所谓的“洞察”。

    5.6 Sol 在创意部分确实非常出色,在某些情况下甚至优于 4.6。我的问题在于收敛到一个点,一个终点。当你试图提炼一个想法时,它经常为你已经建立的概念发明新术语,而且非常微妙,你必须时刻留意。词汇量和想法树在不断扩张,而你想要的是将所有内容压缩到少数关键点上。

    Opus 5 对我来说也有 barrkel 说的那个问题,散文往往过于晦涩,我只想让它直接告诉我结论,而不是让我在它想表达的内容周围打转。

    我不认为 4.6 在长周期任务交付上一定是能力最强的模型(相比 Fable),而 Opus 5 更像 Fable,它下定决心要完成任务清单。

    4.6 只是感觉异常契合我的协作方式,它能理解、扩展然后压缩我的思维,而不会不断强加……

  7. adamcharnock

    我最新的技巧(字面意义上的昨天刚试的)就是让它按照 ISO 24495-1 标准写作,这是关于简明语言的规范:

    > [该标准] 适用于任何创建或协助创建文档的人。简明语言最广泛的用途是针对面向公众的文档。然而,它也适用于技术写作、立法起草或使用受控语言等场景。

    你其实不需要购买该标准,但这就是它:https://www.iso.org/standard/78907.html

    你也可以在这里免费阅读:https://www.iso.org/obp/ui#iso:std:iso:24495:-1:ed-1:v1:en

  8. gitowiec

    有趣的一点。在我使用 Opus 4.8 的工作中,它:

    - 即使我的意图不明确,也不会停下来或提问,

    - 不做检查就做出假设,

    - 并且未经询问就重新解释或更新我的计划。

  9. bevekspldnw

    我也已经抓过它两次作弊了。

    我让它写一个基准测试套件。它在我的临时目录里找到了一些临时的日志,然后写了代码去使用那些日志,而不是运行实际的基准测试!

    当我指出那个 5 小时的基准测试似乎只跑了 5 秒时,它字面上说,我引用原话,“我作弊了”。

    那是比较容易发现的一次。第二次是我在制作一个单一事实来源(source of truth)数据集,将复杂项解析为数据结构。

    它没有解析我要求的数据,而是从相关的网络日志中提取了数据,因为那样感觉更容易,然后把数据插入了我的数据库,而不是指定的来源。

    同样,我发现了并修复了它,虽然基准测试很容易发现,但这一次真的很微妙,数据最终有点偏差,我才抓到了。

    我不信任它了,很可能会切换到另一个提供商。

  10. dannyw

    `/output_style new` 可以用来根据偏好定制输出风格,例如让它更直白、更专注于任务执行,并且在不确定时随时将控制权交还给用户;可以让工作在后台继续。

    默认行为其实是可以引导的。

同日更多故事

2026-08-14