揭秘 Claude 与 GPT 的知识截止线

Exploring Claude/GPT Knowledge Cutoffs and Pre-Training Timelines

揭秘 Claude 与 GPT 的知识截止线

我通过精心设计的测试向 Claude 和 GPT 系列模型提问,试图挖掘它们训练背后的隐藏事实。利用“不可压缩知识探测”和“数据混合推断”等技术,我估算了 GPT-5 和 Opus 等前沿模型的参数量及训练数据构成。通过分析模型对特定日期事实的回答准确率,我绘制出了各模型的知识截止曲线,发现 Anthropic 的 Opus 4.7 及后续版本似乎源自同一训练运行,而 OpenAI 的 GPT-5.6 家族则基于不同的检查点。更有趣的是,通过询问模型“你是谁”,我观察到实验室在训练数据中混入了旧版模型的输出,甚至发现 Anthropic 的 Sonnet 5 会自称为 GPT-4,揭示了训练数据中可能存在的 ChatGPT 对话残留。

我们可以通过向模型提出精心策划的请求来“探测”它们,从而了解前沿模型训练背后的隐藏事实。
  1. tobwen

    根据我对各种模型的实测,我怀疑 LLM 的知识截止线是分区或分立的:比如历史文献(古希腊史、莎士比亚、歌德)不会变,通用知识(仅在某些领域更新),技术(定期更新),软件也出奇地稳定——以 Git 为例,一套基础命令就能搞定 99% 的工作,新功能要么没人知道,要么根本用不上;而八卦新闻类知识则永远实时更新(政治、泰勒·斯威夫特的专辑)。

  2. myworkaccount2

    我好奇这种分析能否提供一种方法,来验证前沿实验室是否在等待合适的时机发布模型。

    在我看来,这些公司显然不会在完成新模型的后训练/测试后立即发布。

    但我们实在无法确切知道任何一家实验室到底“等待”了多久。如果能通过这种方式获得更准确的估算,或许我们就能判断开源权重模型究竟落后了多少。

  3. rad-b

    读起来很棒,分析也很有意思!不过我对 Anthropic 声称“未蒸馏 ChatGPT 用于训练”的说法没那么宽容。也许今天没有,但在 GPT-4 时代,当 Anthropic 还是弱势方时,我觉得这种事完全可能发生。顺便再配上 Amodei 那些聪明的“跳火圈”操作,来证明这其实是一种美德。

同日更多故事

2026-08-10