Moonshot AI 被指蒸馏 Anthropic 的 Fable
We have information that Moonshot distilled Fable for the development of K3

美国前科技政策主管 Michael Kratsios 爆料称,Moonshot AI 在开发 K3 模型时,疑似通过自建平台大规模蒸馏了 Anthropic 的 Fable 模型。据称,Moonshot AI 开发了复杂的内部系统,能够灵活切换多种访问方式以规避检测,并获取了配备 GB300 的服务器,甚至可能通过泰国渠道访问相关算力。Kratsios 强调,虽然合法的模型蒸馏对创新生态至关重要,但这种旨在窃取美国专有技术、破坏美国研究的大型隐蔽工业蒸馏行为是不可接受的。
然而,旨在窃取美国专有技术并破坏美国研究的大型隐蔽工业蒸馏是不可接受的。
HN 评论区
663- himata4113
这重要吗?按任何定义,蒸馏(distillation)都不违法。
HuggingFace 上有数百万个样本,也有明确使用 Fable 输出进行训练的模型,但从未有人对此采取任何行动。
另一个例子是,你能达到的上限最终取决于在该模型上工作的人,否则在收购之前,Grok 本应更具竞争力。
最后,Kimi 的架构与 Fable 截然不同,因为它使用了由 Kimi 团队自己开发的机制。美国 AI 实验室受开源进展的启发,正如开源实验室受 Fable 等模型的痕迹启发一样。
以任何形式声称 Fable 的蒸馏是 Kimi K3 如此具有竞争力的主要原因,都是在诽谤那些共同推动开源模型发展的其他实验室的工作。
编辑:(移到底部)
他们唯一的论点是使用了 GB300 GPU,而不知为何这种 GPU 不应提供给中国公民。
- throwa356262
Kimi K3 于 7 月 16 日发布,而 Fable 的禁令是在 7 月 1 日解除的,但访问权限仍然受限。
Moonshot 怎么可能在如此短的时间内“蒸馏”出一个大模型,还有时间运行基准测试并完成常规的发布流程?
我认为 Anthropic 急于阻止外国竞争,而美国政府也很乐意帮忙,因为他们也 heavily invested( heavily 投资)在这些公司上。
- madduci
那么问题来了?蒸馏仍然是公平的,这和 Anthropic 抓取受版权保护的材料用于训练处于同一水平。
所以这是强盗在指责强盗吗?
这些指控每次都是毫无意义的。
- sent-hil
让人想起比尔·盖茨的那句名言。
> “嗯,史蒂夫(Jobs)……我觉得更像是我们俩都有一个名叫 Xerox 的富裕邻居,我闯进他家偷电视,结果发现你已经偷过了。”
来源:https://www.goodreads.com/quotes/824084-well-steve-jobs-i-th...
- JumpCrisscross
“塞缪尔·斯莱特(Samuel Slater,1768 年 6 月 9 日 – 1835 年 4 月 21 日)是早期英裔美国工业家,被称为‘美国工业革命之父’(该短语由安德鲁·杰克逊创造)和‘美国工厂制度之父’。在英国,他被称为‘叛徒斯莱特’和‘石板斯莱特’(Sam the Slate),因为他将英国纺织技术带到了美国,并针对美国用途进行了修改。他在 21 岁移民美国之前,作为英国工业先驱的学徒,凭记忆记住了纺织工厂的机械设计。”
- linkregister
评论者忽略了这一信息的重要性,而是基于对公平性的感知或幸灾乐祸的情绪发布了情感化反应。
Anthropic 和 OpenAI 的经济可行性取决于它们能否以高于研发和推理成本的价格向用户收取模型访问费用。如果 SOTA 模型访问的市场价格低于这一水平,这些企业就必须决定是继续亏损还是减少研发投入。
Moonshot 的论文 [1] 声称,其训练负载主要来自合成数据和模型自教,而非 RLHF,因此保持了低成本。如果 Moonshot 真的不依赖人工主导的训练,他们将超越美国的闭源模型提供商。美国政府将美国在“AI”领域的霸权视为国家安全考量。
这一声明值得注意,因为它暗示 Moonshot 的成功实际上归功于蒸馏。如果美国前沿实验室发现自己处于补贴竞争对手研究的位置,那么设置障碍符合他们的利益。
1. Kimi K2, https://arxiv.org/html/2507.20534v1
- bradfa
我能理解 AI 实验室可能关心其他实验室蒸馏它们的模型,因为这会侵蚀它们的竞争优势,但消费者真的在乎吗?消费者难道不是从这种做法中受益,从而获得更好、更便宜的模型吗?
- rustcleaner
太好了!希望能看到这些被锁定的 SOTA 模型继续得到解放。云是一个虚拟监狱,因为如果政策在云端远程强制执行,其他人认为用户应该或不应该做什么的规定是无法(轻易)绕过的。所有数字原住民都应该对云端托管的服务或软件持怀疑态度。像情报机构或主权国家一样思考:你会如何被云坑害?你的数据对提供者完全可见,他们可以监控你的活动。你可能无法盗版它,所以你只是他们食利模式下的奴隶。你可能因为提供者在哲学或经济上不同意你的愿望而被阻止做你想做的事。你可能会因为他们的政策执行系统触发而被封禁,从而失去你的信息/数据。
人们应该遵循这一准则:如果你没有拥有文件或对其进行处理,你就没有拥有该事物。这适用于流媒体、软件、机器学习模型、文件存储等。但我跑题了;我很高兴看到这些家长式的食利者被这些解放/复制行动咬了一口,每次打破数字和基础设施的锁,人类利益都会得到服务。我将永远站在蒸馏者这边!
- teravor
大家谈论的关于 LLM 的蒸馏,远没有大多数人想象的那么容易。
前沿实验室都不提供 token 的概率分布,这才是基于大模型训练小模型的实际蒸馏方法。他们甚至不提供所有 token。
因此,前沿实验室抱怨的这种所谓“蒸馏”,只是一套巧妙的方法,将现有的 LLM 纳入新模型的训练过程中。这些方法包括让现有模型对新模型的输出进行评分,并将这些评分纳入 RL 方法中;给新模型分配结构化任务,并使用现有模型作为这些任务的真理来源,以及无数其他技巧。
效率随着模型之间的差距而扩展,通常允许高效的自举过程。然而,暗示蒸馏不会带来进一步进步的推论是错误的,之后你可以开始做前沿实验室一直在做的事情:砸钱让人类提供信号,或在探索性路径上消耗 token 并评估结果。
OpenAI 和 Anthropic 不喜欢的事实是,他们烧掉的所有钱都可以用来造福所有人,而不仅仅是他们自己。而且,无论他们烧掉多少钱来扩大差距,这个差距都会以一小部分的价格被缩小。
- skeledrew
非常有趣。所以 Fable 真的是几周前才发布的?而 K3 是几天前?能在这么短的时间内蒸馏足够的数据、完成训练并进行审查,从而发布一个运行良好的版本,这真是令人印象深刻的壮举。向 Moonshot 团队致敬 :flame:。