Tokenless:自动切换模型,推理成本减半

Launch HN: Tokenless (YC S26) – Automatic model switching to save money

Tokenless 是一个 API 调用的即插即用替代方案,能自动将请求路由到最合适的模型。它的核心逻辑是:大多数请求并不需要前沿模型。Tokenless 会将请求同时分发给多个模型,一旦某个模型明显走上正轨,系统就会选中它并取消其他请求,让你只为真正需要的部分付费。该平台提供兼容 OpenAI 和 Anthropic 的接口。实测数据显示,在保持与 Opus 4.8 相同质量的前提下,Tokenless 的 PRO 模式能将任务成本降低 57%。由 Google DeepMind、普林斯顿大学和加州大学伯克利分校的 AI 研究人员打造,并获得 Y Combinator 支持。

  1. mediaman

    所以这只有在缓存是冷的时候才会切换模型,否则切换的经济账算不过来。但大多数智能体(agentic)工作涉及一连串连续的工具调用,这些调用恰恰能受益于热缓存。热缓存调用能将输入成本降低 90%。这意味着它基本上只能在以下场景节省成本:AI 向用户交付结果,用户等待至少 5 分钟(或缓存时长),然后做出回应。

    但如今,随着工作负载越来越偏向智能体,用户到 AI 的调用其实非常罕见。大多数情况是工具->结果->工具的循环,用户并不参与。而 token 消耗最高的正是这些长运行的智能体链,但恰恰是因为 KV 缓存的存在,路由策略在这里行不通。

    你们打算怎么处理这个问题?

  2. seizethecheese

    非常有趣的思路,可能也是个新点子。我能这么说,是因为我也在做类似的东西(同时在构建 http://pellmell.ai 的代码版)。

    不过我持怀疑态度。为了判断哪个模型走在正确的轨迹上,你实际上需要智能。但真正的智能会让你的系统变得极其缓慢且昂贵。我猜测你们用的是某种分类器,但我怀疑它真正测量的其实是置信度。

    最可能的情况是,对于那种存在不确定性但只有一个正确解的问题,这是个绝妙的方案。但对于存在多种潜在解、其中一些看起来不错实则糟糕的情况,这方案会很糟糕。你们只展示了一个基准测试,我想知道这个基准是否恰好适合这种路由器的特性。你们在 DeepSWE 上跑过吗?

  3. rush86999

    这和 OpenRouter 有什么区别?

    我也为自己的智能体框架开发过类似的东西。它基于模型预测器和指数移动平均:

    https://github.com/rush86999/atom/blob/main/docs/architectur...

  4. popPopBoom

    有趣的思路。多模型进度监控的想法很巧妙,我见过的路由大多要么是静态规则,要么是用廉价的分类器一次性选定。并行查询并在对话中途做决定,感觉不太一样。

    我很好奇的一点是:在难度较高的回合中,你们如何处理同时启动多个模型带来的延迟冲击?面向用户的延迟感觉上和直接调用 Claude 相比仍有竞争力吗,还是说在路由器做决定时会有明显的停顿?

    另外,有计划公开路由决策(或者至少是每个回合选用的模型)吗?这样用户可以在它选错时进行调试。这对你们所寻求的反馈循环似乎很有用。

  5. JoshTriplett

    > Tokenless 将你的请求分发给一组模型,并观察它们的思考过程。一旦某个模型明显走上正轨

    等到模型“走上正轨”时,它其实已经接收了输入 token。粗略估算,对于许多查询来说,输入 token 往往构成了成本的大头,而这会增加此类查询的成本。看起来,它似乎只能降低那些先向模型输入相对少量数据、并在模型开始读取大量输入数据前就能判断其是否“走上正轨”的提示词(prompts)的成本。

同日更多故事

2026-07-29