Fable 5:八月推理能力为何下滑

Fable 5 – Median thinking declined in August

这不是偶然的性能波动。在为期六周的数据追踪中,我发现模型的推理能力在整个周期内持续下降,且在不同时间段内剧烈起伏。即便我始终使用 xhigh 或 max effot 级别调用,深入分析却显示,绝大多数请求几乎未获得任何 thinking tokens。即便偶尔出现较长的思考过程,其表现也远未达到基准测试水平。这些波动往往与特定产品发布节点重合,让人不禁怀疑:模型本身是否变弱?还是我们被分配到了不同的 inference regime?下次感觉模型变笨时,别再问它是否被 nerfed,先问问自己得到了什么样的推理服务。

下次模型感觉变笨时,别问它是否被 nerfed,而是去问自己得到了什么样的 inference regime。

同日更多故事

2026-09-21