用另一个 LLM 清理 Claude 5 的 Token 呕吐

Clean up Claude 5's token vomit with a separate LLM

用另一个 LLM 清理 Claude 5 的 Token 呕吐

面对 Claude 5 生成的冗余 Token 垃圾,开发者 zachahn 推出了名为 Vomit 的工具。这个完全本地运行的项目,通过调用另一个本地 LLM 来“翻译”和清洗 Claude 的输出,将其转化为可读的英文。Vomit 支持 Llama.app 和 Ollama,无需联网且无遥测,虽然速度较慢且可能产生幻觉,但它为那些受困于 Claude 5 过度输出问题的用户提供了一个有趣的自救方案。作者直言不讳地表示,为了节省 Token,不得不承认 Claude 5 已经无药可救。

节省你的 Token,Claude 5 已经无药可救。
  1. trefoiled

    这个问题我已经折腾了好几周,不仅在 Claude 里遇到,在 Codex 里也一样。Codex 虽然没这么严重,但依然让人抓狂。AGENTS.md 几乎没什么用,代理(agents)总是会违反沟通偏好,尤其是随着会话拖得越来越长。让我难以置信的是,竟然没有一种可靠的方法来改变 LLM 对你的回应方式,以至于不得不采用这种变通手段。这简直是对产品承诺的彻底背离。

    这些模型内置的沟通风格烦人至极,已经影响到了我的工作。我最好的描述是:一切都被优化得旨在给用户留下深刻印象,让代理听起来更权威,但实现这一点的代价是刻意的模糊不清、插入不恰当且极其密集的术语,以及古怪生硬的比喻。它们简直像是被训练成专门产出难以阅读的文本。

  2. bob1029

    到了某个节点,人们不得不怀疑:如果我们需要用另一家厂商的模型来 100% 地 babysit(照看)Anthropic 模型的输出,那还有必要继续使用 Anthropic 的模型吗?为什么不用那家厂商的模型来处理所有事情呢?

    我忍不住觉得,这种能登上首页文章的情况,是 OAI 曾经糟糕透顶而 Anthropic 曾经完美无缺那个时代的残留物。正是这种随时间发生的转变,让我避免对技术厂商产生部落主义情结。给拥有 20 万多名员工的组织赋予意识形态动机,只会让我们陷入像这样奇怪的扭曲境地。

    大多数理性的行动者只是简单地从一家转向了另一家。只有对某个“粪坑”有着特殊执着的人,才会继续在这个方向上死磕。

  3. user102030

    看起来这是基于以下提示词的一个包装:

    你是一名编辑。你将收到一条具有奇怪特征的留言:

    - 奇怪的主谓搭配

    - 本该是宾语的主语

    - 极其绕弯子的推理,夹杂着伪顿悟

    - 干扰信息流的节奏

    - 自吹自擂

    请去除这些特征,用清晰、对话式的风格重写。保持留言的意图,并确保不丢失任何细节。

    几条具体规则:

    - 留言通常以第一人称设定

    - 只有人类、人类群体和代理才能执行“动作动词”

    - 宾语永远不能做任何事。以下是需要避免的例子:

    - X carries ...

    - X names ...

    - API 是动作动词规则的一个微小例外。它们可以执行典型操作,如 CRUD、排队、运行和调用。

    - 避免使用破折号(—),因为它会干扰节奏

    你收到的整条消息就是这一大段输出。请回复编辑后的文本,不要包含其他任何内容。

  4. lwansbrough

    我觉得一旦他们搞清楚是什么让 Opus 5 如此令人讨厌,肯定得给它写一份尸检报告(postmortem)。这显然是某种为了迫使模型挖掘更多 token 而产生的副作用,可能因为它对编码和/或工具调用有某种积极影响。但天哪,这对通用沟通来说太糟糕了,简直到了几乎无法使用的地步。

  5. imalerba

    我更喜欢 "Claudish to English" 这个名字。

    https://github.com/gvzdv/claudish-to-english

  6. ericpauley

    我怀疑长期阅读 Opus 5 那令人发指的糟糕文风,实际上会造成心理伤害。我们现在正认真考虑将所有的 Anthropic 预算转移到 Codex 或开源权重模型上。这已经是一个关乎心理健康的决定了。

  7. nl

    Twitter 上流传着一种理论,大致内容如下:

    Anthropic 内部员工自二月起就开始使用 Mythos 来编排他们的(Opus)子代理。效果很好,随后的强化学习(RL)运行利用内部数据对此进行了优化。这种 RL 将 Opus 优化为了代理间的沟通,这就是为什么你会看到那些奇怪的选词和巨大的自我辩护段落。

    我觉得这个理论很有道理。显然有些不对劲,而且如果你曾用 Fable 运行过 Opus 子代理,你会发现它几乎神奇地好用。

    希望他们能修复 Opus 5.1 的 RL 问题。

  8. wood_spirit

    关于这件事的元评论(Meta):还有人记得那些日子吗——那是很久以前了,至少是几个月前!——当时 Anthropic 对美国政府所持的道德立场(加上大家普遍认为他们拥有最好的模型),让他们成为了 HN 上备受支持的弱势冠军?

    最近 HN 上的氛围似乎变成了他们已经“跳过了鲨鱼”(jumped the shark,意指盛极而衰、自毁声誉)?他们的品牌不再散发着道德感,他们的模型也令人失望?

同日更多故事

2026-08-20