Echo: 动态调度开源模型实现高性价比推理

Show HN: Echo – Fable-level results at 1/3 the cost using open-weight models

我开发了Echo,这是一个创新的AI系统,它不再依赖单一模型,而是从GLM-5.2、Kimi K2.7等开源模型池中动态选择。Echo能根据每个请求的智能分配计算资源,决定哪些模型参与以及如何组合它们的输出。在构建过程中,我发现不同模型间存在惊人的互补性,即使整体较弱的模型在特定任务中也能发挥关键作用。Echo在保持与Fable相当性能的同时,将推理成本降低了约三分之二,并提供了聊天界面和OpenAI兼容API供开发者测试。

Echo让我惊讶地发现,模型之间是如此互补:一个整体较弱的模型,在特定问题或组合中依然能发挥巨大价值。
  1. fmx

    一个名为“消息回显(Message Echo)”的文本框,让你误以为无需登录就能获得提示词的回复,结果却直接跳转到注册页面。这种经典的黑暗模式(dark pattern)简直太典型了——而且这绝对是我立刻离开你网站的理由。

    我字面意义上只在你网站上迈出了一步——也就是你的网站设计邀请我迈出的那一步——结果立刻就被绊倒了。我不会再回来了。

  2. adam_rida

    感谢大家花时间试用 Echo 并分享反馈,这正是我选择尽早发布的原因。

    我将尝试回应几个被频繁提及的话题:

    - 我会持续发布更严格的评估结果,包括更具挑战性的代码和智能体(agentic)基准测试,以更精确地描绘我们与 SOTA(最先进模型)之间的差异。

    - 公共评估仪表盘将持续扩展并更新(也非常欢迎大家提出更多基准测试建议!)

    - 部分用户在评估仪表盘 UI 和注册流程中发现了问题,这些问题现在已在生产环境中全部修复。

    另外几点重要说明:

    - 试用 Echo 无需信用卡。

    - 每个账户包含 10 美元免费额度,可用于 API 和聊天两种模式。

    关于技术思路本身:我探索的理念比单纯的模型路由(model routing)更广泛。我关注的是如何在开源权重模型之间高效分配推理资源,这不仅涉及选择使用哪些模型,还涉及决定每个请求应分配多少计算资源,以及如何组合中间计算结果。

    集成(ensembling)本身并不新鲜。自从随机森林(random forests)甚至更早的统计学/经典机器学习领域,我们就知道将多个模型组合起来往往能超越单个模型的表现。Echo 面临的有趣问题在于:如何建模并利用这一特性,同时避免在每个请求时都支付完整的集成成本。

    虽然与 Fusion 或 Fugu 等系统存在概念上的相似性,但我们的架构和优化目标截然不同。

    再次感谢大家提出的深思熟虑的反馈。

  3. cheema33

    > 以 1/3 的成本实现 Fable 级别的效果

    我猜这并非针对我们这些订阅了重度补贴的 200 美元/月套餐的用户。当然,这些套餐可能是临时的,但没人真正知道它们能持续多久。在那之前,仅按公开 API 定价的 1/3 收费,对我们来说吸引力并不大。

  4. runtime_lens

    我不惊讶于在未来几年内,“最佳模型”这一概念可能会变得小众化。

    对于大多数生产系统而言,最终胜出的架构可能是一个编排器(orchestrator),它知道何时调用廉价模型,何时升级到更强模型,以及何时组合多个输出结果。

  5. subygan

    如果你无法提前预知问题的复杂度,并确保所有后续对话都指向同一个模型,这套方案其实效果并不理想。

    否则,通过在不同模型间对同一对话进行轮询(round robin),你会破坏缓存。最终你支付的代价很可能高于使用具备缓存感知能力的系统。

  6. kamranjon

    没有基准测试,没有关于使用了哪些模型的信息,只有 AI 生成的视频,除此之外只有一个注册页面。

    无论如何,这让人想起那句关于架构的名言:“我们将单体架构替换为微服务,以便每次故障都更像是一起谋杀谜案。”

  7. dluan

    所以,这是 AskJeeves、AltaVista 和 Lycos 时代的老套路重演吗?时间是个扁平的圆?

  8. tj800x

    没有统一的登录入口。隐私政策允许用于训练。没有无需信用卡的免费试用。这个想法不错,但目前看来为时过早。

同日更多故事

2026-07-23