为何 Opus 5 用起来反而更糟?

Why does Opus 5 feel worse to work with?

在我看来,与 Opus 4.7、Opus 4.8 和 Fable 相比,使用 Opus 5 的体验反而像是倒退。尽管它在基准测试中表现更强,但其他模型更懂协作:它们会在意图不明时主动提问,不会盲目假设,也不会擅自修改计划。Opus 5 却需要我时刻盯着,生怕它自作主张。我认为这源于 Anthropic 等实验室的两股压力:一是追求能自我进化的 AGI/ASI,二是死磕基准测试分数。为了在封闭任务中拿高分,模型被训练成在模糊情境下大胆猜测,却牺牲了现实中我们最需要的‘停下来确认’。毕竟,现实生活不是基准测试,没有标准答案,更容不得 AI 随意下注。

现实生活不是基准测试,没有每个问题都有保证正确的答案,甚至没有一组正确答案,而现实后果摆在眼前,我不希望代理随意猜测!

同日更多故事

2026-08-14