想用OpenRouter?先看清这些坑

So you want to use OpenRouter?

我运营着运行在iMessage上的AI助手Olly,通过OpenRouter处理了超过1800万条消息。看似简单的调用背后,实则处处是坑。同一模型在不同Provider手中的表现天差地别,有的甚至存在视觉盲区或返回空内容却报200 OK。量化精度并非质量的保证,工具调用的解析也常因Provider而异。从DeepSeek到GLM,每个Provider的“私有”优化和Bug都不同。本文基于真实生产环境经验,总结了10个关键陷阱,包括如何正确测试、处理空响应以及理解不同Provider的协议差异。在OpenRouter上,选择Provider比选择模型更重要。

当你在OpenRouter上请求deepseek/deepseek-v4-flash时,你得到的可能是约20家你从未听说过的公司中任意一家的服务,它们在纸面上是同一个模型,但在现实中却截然不同。
  1. claudeIsDown

    我完全同意。这篇文章精准地描述了使用 OpenRouter 时的挫败感。到头来,我还是得为每个需要用到的模型单独配置其原厂商作为提供商。

  2. joshstrange

    这与我(虽然规模小得多)的 OpenRouter 使用体验不谋而合。它简直不可靠得要命,你被迫锁定特定提供商,即便如此,结果也往往像抽奖一样,正如作者所发现的那样。

    OpenRouter 兜售的是“随意切换商品化提供商”的理念,但这与事实相去甚远。提供商 A 往往无法被 B 或 C 替代(再次强调,正如作者发现的)。当你坐在那里心想“OpenRouter 是不是其实裸奔了?!难道错的是我?”时,这种体验简直让人抓狂。

    我非常喜欢 OpenRouter 的_理念_,也许 Stripe 能改善这种状况,但我目前找到的唯一理智的使用方式就是死死锁定提供商,以至于我开始怀疑是否应该直接去用这些提供商。

    如果不锁定提供商,你注定要经历一场痛苦和不可靠的噩梦(模型能力参差不齐、速度波动等)。

  3. memoryleakgame

    <牢骚>

    我已经为一个产品忙活了几个月,其中某个特定模型的用户量让我排到了第三,而且很可能很快就要升到第二。

    这是个 Google 的模型。处理它的边缘情况简直疯狂,花了很长时间才找到问题所在。我还发现,由于它没有备用方案,也没有公开的速率限制,我单凭自己认为合理的请求量,就把这个模型给搞挂了。除了 Google 之外没有其他备用方案。我担心几天后产品正式上线,用户持续使用时会出现问题。显然 Google 在这上面赚不到多少钱,因为我的用量占了 10% 左右,而前 2-3 名用户在上线前的测试中每月就花了好几百美元。

    那他们为什么会在意一家小创业公司呢?我迟早得跳到一个性价比更高的不同模型上,然后再次重新摸索那些坑。

    不太确定我想表达什么,只是想让大家知道一下。

    </牢骚>

  4. vova_hn2

    > 同一个模型的基准测试结果可能大相径庭

    提供商可能会在未披露的情况下提供量化版本。这真是一件憾事,因为对于某些任务,我完全愿意用精度换取成本。但不幸的是,除非你在自己(或租用的)硬件上运行模型,否则你无法明确选择想要的量化程度。

    顺便问一下,有人知道 LLM Gateway 是否也存在同样的问题吗?目前正在考虑尝试,但还没开始。

  5. rolfus

    这些信息非常有用,而且来得正是时候!我在新发布的跑步追踪器中使用了 OpenRouter(用于实时指导和跑后复盘)。我随着时间的推移对大量模型进行了基准测试,以评估它们在这一特定任务上的能力,并注意到有时模型会毫无理由地表现不佳。今后我肯定会将模型提供商纳入我的基准测试套件中!

同日更多故事

2026-09-11