Kimi 与 Claude 的写作风格惊人相似
Writing fingerprint analysis of responses reveals Kimi's similarity to Claude

这项研究通过交叉熵分析,仅凭文本用词就绘制出了大语言模型的相似性热力图。结果显示,Kimi 与 Claude 在写作风格上表现出高度的一致性,仿佛共享着某种独特的语言基因。研究团队统计了各模型的字符三元组、单词和短语频率,并计算了它们相对于整体语料库的熵值。这种基于纯文本统计的方法,绕过了复杂的语义理解,直接揭示了模型底层的“指纹”特征。对于关注模型同质化或试图区分不同 LLM 输出来源的开发者而言,这份数据提供了直观的量化依据,也引发了关于模型训练数据与风格趋同的深层思考。
一张仅由大语言模型的文字构建而成的热力图,揭示了哪些模型写得如出一辙。
HN 评论区
63- throwa356262
这数据本身就有问题:除非 Moonshot 有时光机,否则 K3 应该更像 Opus 4.5-4.8,而不是 Fable 5。
别忘了,Anthropic 大概在 4.5-4.6 版本左右就开始限制访问并引入防蒸馏措施了。所以大部分蒸馏行为应该发生在更早的模型上。
也许更合理的解释是,他们能访问相同的训练数据集?如果是私有数据,那又会引发关于数据盗用的质疑,但性质完全不同。
- causal
这展示的是相对于其他模型的差异,但我对这些数字的绝对意义没什么概念。
K3 到 Fable 的相似度是蓝色的 0.42。0.42 有意义吗?还是说我们故意把下限设为 0.4,就是为了显得 0.42 很显著?
Sol 到 Fable 是 0.69,显示为深黄色,看起来和 0.42 差别巨大。但真的吗?这些数字在绝对意义上到底代表什么?
- orbital-decay
>character trigrams
毫无价值。任何基于 n-gram 的 LLM 输出相似度指标,不管你怎么粉饰,都跟测量火星表面平均温度差不多,根本没法保证确定性。Twitter 上曾经流行过一个 n-gram 基准测试,显示 grok-3-beta 和 gpt-4.5-preview 极度相似,可这两个模型是用全新的基座训练的,发布时间仅隔两周,而且风格截然不同。结果每次运行都 wildly inconsistent( wildly 不一致)。但这并没阻止大家相信它的创造者,说 DeepSeek R1 是用 o1-preview 训练的(这明显也是扯淡,两者差异大得不能再大了)。真不可思议,网上随便放点什么,大家就会照单全收,既不去核实,甚至都不理解自己在看什么。
不过 K3 确实是用 Claude 的输出训练的——它在推理过程中会原封不动地复现 Anthropic 的提示注入,只要你两个模型都折腾过一段时间,应该早就知道了。干得漂亮。
- josh-paul
这看起来更像是基于行为(behavior based)的,而不是基于 logits 的?到底在主张什么?
- kingstnap
别忘了,如果你用中文问 Claude 它是什么模型,它会回答自己是 Deepseek、Qwen 或者 Kimi。
所以到底是谁在训练谁的输出?