Castform+Neon:100倍成本击败GPT-5.6-Sol
Beating GPT-5.6 Sol on retrieval with 100x cheaper open models

传统RAG管道正被多跳搜索的Agentic Retrieval取代,但频繁调用GPT-5.6-Sol导致成本飙升且延迟高企。Castform与Neon联手,利用企业私有数据构建训练集,通过RL后训练让开源模型在检索任务上超越前沿闭源模型。这套方案不仅将单次请求成本降低100倍,还利用Neon的动态计算扩展和分支功能,完美解决了训练过程中的突发负载与隔离环境问题。无需复杂ML基础设施,开发者即可将内部知识库转化为高效智能体,实现低成本、低延迟的精准检索。
大多数团队的最佳训练数据正沉睡在数据库中,难点在于将原始数据转化为可用资源,而让智能体大规模廉价地读取、搜索和修改数据需要先进的基础设施,Castform指向Neon则完美规避了这两大难题。
HN 评论区
114- softwaredoug
这类专用模型的应用前景非常广阔。理想情况下,应该有一个调度框架能自动启动子代理,将特定任务卸载给针对性模型。我知道这并非什么新点子。Claude Code 就做过类似尝试,把“探索”代理的工作交给 Haiku 处理。看到专用大语言模型正在被开发出来,我真的很兴奋。
- mrinterweb
大厂模型在学术上或许很有意思,但从商业角度看,长期来看它们恐怕要凉凉了。当模型变成纯粹的大宗商品,而别人能提供便宜几个数量级的选项时,这些模型公司根本没法竞争。
这并不是说大厂理论上不能推出便宜 100 倍的选项,而是他们的商业模式必须依靠高价 token 产生巨额营收,否则就会崩盘。
- cmiles8
这里还有一个更严肃的问题没人回答:随着干草堆越来越大,检索机制在寻找其中隐藏的针时究竟有多有效?还有一个相关问题:如果干草堆里需要找到成对的针,且必须持有一根针才能解锁找到另一根针,这种情况下你的效率又能有多高?
- jillesvangurp
这感觉就像是数据库领域的“使用正确的数据结构”。过去两年我们一直默认最大的通用模型应该能搞定一切。如果路由成本可以忽略不计,那么让检索、重排序、推理和生成各自拥有优化过的专用模型,显然更合理。
- aliljet
我(我想很多人也一样)很想用这类东西,但用不了,因为我的数据太敏感,不能上传到那些我无法保证隐私和安全的云端。
有没有办法通过租用 GPU 和开源软件栈来实现?付费不是问题,我不在乎是免费还是被抽成,我只不希望服务商能接触到我的数据。