让 Claude 只改按钮颜色,别动别的

Claude, change the "Add to Cart" button to blue

让 Claude 只改按钮颜色,别动别的

在 Opusfived 的演示中,我们尝试给 Claude 下达一个极其具体的指令:将“Add to Cart”按钮改成蓝色,同时严禁它修改页面其他任何内容。这个看似简单的任务,实则是对大模型指令遵循能力的极限测试。在生成式 AI 日益普及的今天,如何让模型精准执行单一操作而不产生幻觉或过度修改,成为了开发者面临的现实挑战。这次实验揭示了当前模型在细粒度控制上的表现,也提醒我们在实际应用中需要更加谨慎地设计提示词。

把“Add to Cart”按钮改成蓝色,别让 Claude 改动其他任何东西。
  1. dudeinhawaii

    太棒的网站,勾起了回忆!哈哈。

    试着为这场讨论补充一点——虽然这类循环我见得少了,但我确实见过“过度热心”的情况。

    现在的模型总想反复三番五次地检查。我有点夸张,但这简直到了“我已经有现成的解决方案了,但让我用 Rust 写个变体来确保收敛解并证明它可行”的地步。

    我现在不得不经常叫停模型,因为它们在验证时简直让人抓狂地死抠细节。Opus 在这方面其实是最死板、最容易“跑偏”的。不过话说回来,这倒也不是坏事。我通常的反应是:“别测这应用跑 50 次的延迟了……这只是第一版……我们后面还要改上百万次……你这样对我们毫无帮助”。

  2. dwedge

    我之前被这事儿烦得不行,后来才反应过来这是个可选的游戏,直接关掉标签页就行了。

  3. _fat_santa

    至少对于 Codex 来说,我的体验完全不是这样。它确实还是会搞砸,但在每种情况下,我都可以问“你为什么这么做”,它能回溯导致它做出那个特定决定的原因。通常总是因为我没把问题描述清楚,或者犯了个蠢错(比如昨天我就把任务在错误的项目上执行了),或者是技能文件里的指令让它这么做的(这时候我就修正指令)。

    千载难逢地,它确实会在思考过程中犯实质性错误,那时我才不得不回去重做。

  4. captainbland

    这恰恰是人们继续使用 AI 的原因:可变奖励机制。这本质上就是赌博。

  5. johnisgood

    > 为什么半个网站都变蓝了?我让你改一个按钮。

    > 半个网站都变蓝了。我只要改一个按钮。

    当网站明显没变蓝,只有两个按钮变蓝时,这就是我的全部选项。

    我之所以比这更具体,是有原因的。

  6. kstenerud

    这也太奇怪了……这完全不符合我对 Claude 的体验。我从来没见它这么干过。

  7. JohnMakin

    > 值得指出的是:添加到购物车的按钮还是黑色的。

    这话让我笑出了声。如果你只给结果而不具体说明实现细节,有时候体验确实就是这样,而且这种反应往往突如其来,有些日子比别的日子更糟糕。

    我已经对它很有耐心了,但不管这种输出风格叫什么或是在做什么——它既居高临下又毫无帮助,看起来就是故意让人抓狂的。

  8. nelaggy

    太神了,你是怎么拿到我的会话记录的?

  9. oujiii

    哈哈,这完全就是我最近的感觉。因为这个原因,我觉得跟这个模型一起工作简直无法忍受……有什么技巧能让它别把事情搞得太复杂吗?我想我还是去找 Codex 吧。

  10. nonethewiser

    我完全觉得这不能代表 Claude(是 Opus 吗?)。我的经验告诉我,如果我让它把“添加到购物车”按钮改成蓝色,它不会把取消按钮也改成蓝色。

    我猜这只是一个虚构的例子?

同日更多故事

2026-09-09