500美元微调9B模型,碾压前沿大模型
A $500 RL fine-tune of a 9B open model beat frontier models on catalog review

自ChatGPT问世以来,企业都在追问AI能带来什么。Ramp数据显示,AI投入最高的企业营收翻倍,而零投入企业仅增长15%。关键在于重塑流程而非简单替换任务。本文揭示赢家策略:利用开源模型,结合专有业务数据,通过强化学习(RL)进行微调。在目录审查任务中,经过GRPO微调的9B开源模型,以每千条0.5美元的成本,将质量提升至87%,远超前沿模型。Bridgewater、Harvey和Intercom等公司已验证,拥有专属智能模型能大幅降低成本并提升表现,这标志着从通用API向私有化智能的转型。
拥有你的智能意味着在性能和成本上都能获胜:一个针对你特定工作流和环境训练的模型,极有可能胜过从未见过你公司内部情况的通用模型。
HN 评论区
128- cmiles8
各大实验室似乎没搞懂的一点是:绝大多数应用场景根本不需要那种拥有50个博士、能讲12种语言的模型。大多数应用场景都是在成本至关重要的约束条件下定义的。
随着开源权重模型和廉价微调服务成为常态,这些实验室在军备竞赛中构建巨型模型的整个经济框架将彻底崩塌。同样崩塌的,还有那个为当前由复杂债务网络广泛资助的大规模基础设施建设辩护的经济图景。
这正是开源权重模型对他们构成如此巨大威胁的原因。所谓的政治因素和“这是中国”的角度,大多只是掩盖他们真正恐慌原因的幌子。
模型如今已变成纯粹的商品,这对大实验室来说已经够糟糕了。如果小型开源权重模型成为常态,大实验室就彻底完蛋了。
- h_mirin
每次看到这类新闻,我都有两点困扰。
首先,我多次观察到,前沿模型的免费改进所取得的收益,往往超过了重新训练带来的增益。从现有模型中榨取更多价值,或者干脆什么都不做、静待其变,这确实是一种策略,而且往往回报更好。公平的对比对象不应该是今天的前沿模型,而应该是在你维护微调模型期间所发布的那些模型。
其次,500美元的训练账单只是这个故事里最便宜的一项。昂贵的部分在于数据创建以及模型训练后的维护。究竟有多少应用场景能真正产出17.7万条评分数据?在这里,他们不得不利用 Amazon Berkeley Objects 合成生成这些数据。在我看来,这个数据集是文章中最有力的证据,证明了微调有多难落地:如果数据天然存在,根本没人需要去制造它。
- himata4113
我真正开始注意到的是,SOTA 模型非常擅长让自己失业。
我们已经在 GPT 身上看到了这一点:Luna 能完成 Sol 90% 的工作。中国之所以还在费力“蒸馏”模型,唯一的原因是为了生成准确的训练数据,而 OpenAI 和 Anthropic 为了收集这些数据、同时规避法律挑战,已经花费了数年时间。
模型越智能,人们就越会转向更便宜的解决方案来完成任务。当准确率已经达到99%时,使用 SOTA 模型并没有真正的额外收益,我认为这才是美国实验室面临的最大危险。
- hermitShell
在封闭领域、非生成式问题上,微调通常能胜过几乎所有其他方法。
LLM 之所以强大,部分原因在于它们是生成式的,因此能够处理开放领域的问题。
- npn
我希望小模型能胜出,我也一直在不断尝试它们。我从未尝试过微调,也没有那样的预算。我的方法是减轻模型的负担,将部分工作交给 Agent。
工具调用就是一个例子——在某些任务中,RAG 效果非常好,包括代码 Agent,其中代码、git log、Epics/Tasks、依赖源等都以非常结构化的方式存在。如果你能运行独立的提示词并检索实际工作所需的数据源,而不是把这些都塞进提示词里,就能节省大量额外的工具调用。
我真的很想聚焦于搜索——如果我们想用 RAG 替代微调,这就是关键技术。如果我们能用混合搜索方法在提示词中呈现真正具有上下文关联的数据源,你会发现即使是小模型也能轻松获得更好的结果——无论是决策还是摘要。