Harness 才是关键:AI 工作流新范式
The Harness Is the Thing

作为一名开发者,我意识到真正的生产力飞跃不在于盲目追求最新的 LLM,而在于构建一个强大的 Harness。通过整合 Cursor、Claude 和 Pi,我建立了一套包含 planner、worker、critic 和 promoter 的自动化工作流。这种架构让我能利用 Deepseek 等商品化模型处理大部分任务,仅在关键规划阶段调用 Fable,从而将高级模型的使用成本降低了 75%。Harness 不仅统一了我的开发体验,还让我能像操作传统工具一样驾驭 AI,让单兵作战也能达到大团队的产出质量。
我逐渐明白,Harness 才是核心所在;它是我的预期与 LLM 能力相遇的支点。
HN 评论区
39- _pdp_
我们聊的是流程,而不是结果。我觉得结果会自己说明一切。
- AirMax98
读完这篇文章,真希望我能有一套稍微好点的工作流。我现在几乎完全依赖 Fable,甚至都不怎么用其他模型了,而且我已经快碰到每周的使用限额了。我真的是在借时间过日子——等到 Anthropic 在八月底取消那 50% 的使用量提升时,我肯定被迫要切换工作流。到时候,我很难想象自己还会坚持只用单一提供商的单一模型。
- esalman
我上周学到的东西是:harness 本质上就是一个 while 循环。
每次迭代你调用一次 LLM,执行一些操作(比如调用工具),增强提示词(追加或压缩等)——顺序不一定非要这样——然后继续。
直到满足结束条件。然后跳出循环。
- andai
我对 Luna 非常满意,但我的做法是“多次小幅度修改”,这种需求下模型早在一年前就达到饱和了。
(我也试过“让大模型一次性做大幅修改”的方法,心理阴影到现在还没缓过来。代码库可能永远也缓不过来了!)
另外,Luna 和 DSV4 Flash 现在看起来水平相当,除了 Luna 更快更便宜?
- nullbio
关键是用开源模型结合你自己的推理轨迹进行 LoRA 自适应学习。如果大实验室想和“运行你自己的模型”竞争,那它们面前的任务简直浩大——基本上得给每个用户都配一台专属的持久化虚拟机。等一切尘埃落定,我觉得它们真正的护城河恐怕只剩下作为推理/硬件提供商了。Stripe 收购 OpenRouter 是一步非常聪明的棋。