Databricks 如何降低 70% AI 编码成本

Databricks drove down AI coding spend 70%

Databricks 如何降低 70% AI 编码成本

AI 编码工具虽能大幅提升效率,但随之而来的指数级成本增长正让企业陷入两难。Databricks 分享了一套经过 Stripe、Coinbase 等公司验证的降本方案,成功将 AI 编码支出降低了 70%。核心策略包括:快速迁移至性价比更高的开源模型,利用 Omnigent 等 Meta Harness 实现模型灵活切换,通过 Unity AI Gateway 进行动态请求路由,以及建立透明的预算监控与分级熔断机制。此外,通过优化上下文压缩和 Prompt 缓存,还能进一步削减 Token 开销。这些方法在保障开发体验的同时,让 AI 成本回归可控范围。

效率前沿由那些在给定智能水平下拥有最佳价格点的模型集合所定义。
  1. extr

    我真的很想听听 Databricks 内部开发者的实际体验。我在一家小型初创公司工作,我们的 AI 预算几乎是无限的——核心逻辑就是,既然我们的人力成本相对于 Token 来说太贵了,就应该在每一个可能的机会上转向 AI。所以通常的流程是:

    - 大部分时间花在优先排序和讨论该做什么上。

    - 一旦达成一致,就用 Fable 5 High + 5.6 Sol XHigh 来制定设计和计划,并确认高层方案。(通常这归结为在“最小补丁”到“完全重构”的频谱中选择变更的位置)

    - 使用 Opus 5 或 Sol Med 来执行。

    - 自动修复 Bug 并运行 CI 直到全绿,再加上三次“热核审查”技能。

    - 人工质询变更细节和吹毛求疵。

    - 制定 QA 计划,让 Codex Computer Use 去执行。

    - 人工抽查最终结果(通常是一个巨大的 diff,几千行代码,完整的端到端功能等)。

    我每天的开销至少是 80 美元,但我产出的成果相当于 3 到 4 个 2022 年的工程师,而且质量可能更好。所以这绝对物超所值。如果换成 GLM 5.2 之类的模型能省钱吗?也许吧?我不确定。在我们这个规模,花时间去构建评估工具来真正理解性能权衡是不值得的。

  2. lbriner

    像这样的文章多得出奇,内容大致都是:“我们开始使用 AI 工具,结果每年花费数百万美元”。

    在哪个星球上,人们开始付费时却不关注成本,直到花了一笔巨款才有人注意到?我不明白。你要么是预先支付一笔固定金额(对此你感到满意),要么是按量付费(PAYG),这种情况下你肯定会估算一下大概要花多少钱。

    否则,这读起来就像个假问题,因为事情其实根本没发生,你只是预见到了风险(你也确实应该这样做),然后加了一些护栏而已。

  3. sashank_1509

    我怀疑对于复杂的硬核软件产品来说,你最好忽略智能体(agents),坚持做“传统编程”。你在短期速度上的损失,会在可管理的复杂代码库上得到补偿。

    如果你有一个 50 万行的代码库,甚至超过 50% 是由智能体编写的,那你就陷入了一片痛苦的泥潭,从长远来看,这根本无法证明其成本是合理的。

    当然,有些产品虽然代码量大,但本身并不复杂。这通常是指那些拥有数百甚至数千个功能的项目,但大多数功能是独立的,并没有以复杂的方式相互交互。想想一个拥有日历、邮件集成等数百个功能的项目管理应用。在那种情况下,我认为智能体能让你物超所值。这只是我在使用智能体工作时的个人想法。

  4. platinumrad

    小心点。如果你承认使用了非 OpenAI 或 Anthropic 训练的模型,你可能会被带到国会听证会面前:https://www.scmp.com/news/china/diplomacy/article/3362616/us...

  5. sandeepkd

    我觉得这在某些层面上既有趣又滑稽:

    1. Codex、Claude 等公司试图在它们自己的层级切换所使用的模型,以管理成本和结果。

    2. 现在像 Databricks 这样的公司又在上面开发了一层,来做同样的事情,即寻找基础框架和适用的模型。

    像 Codex 和 Claude 这样的公司正大力聚焦/投资,以确保人们直接使用它们的框架,或者使用它们的 API。除非 Databricks 有某种协议在位,否则它们就是在违反服务条款(TOS),并公开发布文章谈论此事。如果 OpenAI 或 Anthropic 回来索要 API 使用费,所有的节省都会化为乌有,这将非常有趣。

  6. dgellow

    我从这篇文章中得出的结论是:模型已经商品化了,而且很明显没有人拥有护城河:模型路由可以随时在发布新模型时进行切换,AI 实验室必须继续在跑步机上不停奔跑,否则就会被取代。从长远来看,我无法想象这会是高利润的生意。至于框架的路由,任何区分提供商与另一家的东西都不会暴露给用户,也无关紧要。

    这又为“OpenAI 和 Anthropic 不是可行、可持续的商业模式,无法证明其 1 万亿美元估值和计算投入水平是合理的”这一论点提供了一个数据点(提醒一下,OpenAI 已承诺到 2030 年在基础设施上投入超过 7500 亿美元)。

  7. bisonbear

    这种方法似乎从根本上依赖于能够通过在自有代码上进行特定领域的评估来评测代码智能体。有了这些知识,你才能信任路由逻辑实际上是在降低成本的同时提升或保持了性能。

    如果没有对智能体性能的洞察,任何此类变更都感觉像是在以牺牲开发者生产力为代价来冒险省钱。

    我实际上正在构建通用的特定仓库基准测试,地址是 https://stet.sh ;)

  8. nichochar

    这篇文章令人惊讶地务实且信息量巨大..

    向 Databricks 致敬,我也觉得很有趣,像 Stripe、Ramp、Databricks 这样截然不同的公司,竟然都在构建完全相同的内部工具。

    我认为未来构建公司的样子会变得更加通用,因为智能现在就是一种 API 了。

同日更多故事

2026-08-07