Xiaomi MiMo v2.6:透明训练成开源新标杆
Xiaomi 推出的 MiMo v2.6 开源模型引发了社区热烈讨论,其核心亮点在于前所未有的训练透明度。团队不仅公开了实时训练仪表盘,还详细披露了方法论与各项基准测试数据,包括模型表现不佳的部分。这种坦诚态度被许多开发者视为对 OpenAI 和 Anthropic 等美国实验室的正面挑战。讨论中,用户对比了 MiMo、DeepSeek、Claude 和 GPT 等模型在成本与能力上的差异,认为中国模型正以高性价比和快速迭代速度缩小差距。尽管存在对基准测试真实性的质疑,但 MiMo v2.6 在特定任务中的表现已让不少开发者开始重新评估开源模型的价值,甚至考虑将其部署到本地环境。
如果未来要发布开源模型,请务必考虑向社区提供更多这样的透明度!
HN 评论区
470- rao-v
我知道大家对什么是真正的开源模型(开放权重、开放训练数据、开放训练代码等)有着强烈的观点,但我真的很欣赏他们在该模型训练过程中展现出的透明度。
他们在训练期间共享的实时仪表盘(https://mimo.xiaomi.com/rl/)对我来说是一个极好的学习和教学工具,而且他们在分享方法论细节方面异常全面(看看那份技术报告——里面有很多像 Google 或 Deepseek 技术文章那样巧妙的幕后技巧)以及基准测试分数(甚至包括他们表现不佳的部分)。
如果你打算未来发布开源模型,请考虑向社区提供更多这样的透明度!
- margorczynski
长期来看,中国很可能会赢得这场 AI 竞赛,因为美国面临一个主要瓶颈——能源。中国在电力能源和电网建设方面早已进行了大规模投入,美国根本不可能在短时间内迎头赶上。
无论投入多少资金,你都无法凭空变出 100 座核反应堆来为数据中心供电。
- stymaar
Flash[1]:总参数量 309B / 激活参数量 15B
Pro [2]:总参数量 1.02T / 激活参数量 42B
- user43928
我不相信任何显示 Opus 5 超越 Astra 或 Fable 5.1 的基准测试。
也许 Terminal Bench 4.0 和 ExploitGym 还算合理。
Terminal Bench 4.0
GPT 6 Astra 59.6
Claude Fable 5.1 55.1
Claude Opus 5 49.0
MiMo-V2.6-Pro 34.9
MiMo-V2.6-Flash 28.8
DeepSeek V4.1 Flash 26.8
MiMo-V2.5-Pro 1.5
ExploitGym
GPT 6 Astra 42.4
Claude Fable 5.1 30.4
Claude Opus 5 22.1
MiMo-V2.6-Pro 17.8
MiMo-V2.6-Flash 6.0
MiMo-V2.5-Pro 0.1
DeepSWE v1.1
DeepSeek V4.1 Flash 74.2
Claude Opus 5 74.0
GPT 6 Astra 74.0
MiMo-V2.6-Pro 71.9
Claude Fable 5 70.0
MiMo-V2.6-Flash 67.9
MiMo-V2.5-Pro 19.0
- simonw
Flash 的 Pelicans:https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
Pro 的 Pelicans:https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
- nemothekid
看了这些前端设计示例;为什么这些模型似乎都迷上了“01 - 大写字母文本”这种风格?现在到处都是(参见 https://try.cloudflare.com/,上面有 '01 · QUICK TUNNELS',但找不到任何 '02')。
- vatsachak
哇,中国实验室越来越擅长发布模型时的营销了。护城河很浅。
我喜欢这次发布的一些特点:
- 展示了多样化的任务,例如使用 DAW(数字音频工作站)
- 来自各种基准测试和价格区间的图表
- 模型在科学环境中的实际应用
- toephu2
我几年前就说过,LLM 是一种大宗商品(或者当时正在变成这样)。它们多如牛毛。即使是前沿模型也是如此。OpenAI 和 Anthropic 没有任何护城河。
虽然没有护城河且竞争激烈,但这对消费者来说是好事。
- volf_
我有一个在 Dual DGX Spark 上运行该模型的有效方案:https://github.com/volfco/spark-vllm-docker/blob/main/recipe...
平均速度约为 25-35 tok/s,作为第一次尝试来说不算差。
- GodelNumbering
Mimo 是我从一开始使用时就一直支持的那个模型。我大量使用的 2.5 pro 版本非常简洁,非常清楚不同任务需要阅读多少上下文,并始终保持上下文紧凑。此外,它在战略思维方面也出奇地好。我曾发布过它与 Terra 的对比,发现 Terra 在类似任务中使用的平均上下文要多得多 https://dirac.run/posts/gpt-5-6-vs-mimo-2-5-pro-context-bloa...
一个有趣但不足为奇的普遍趋势似乎是,Flash 模型似乎已经追上了 H1'26 的 Pro 级模型。所有实验室都在争相推出更大模型,这并不令人意外。
编辑:哇,仔细查看了基准测试。Mimo 2.6 pro,这个 1T 参数的模型在 15 个基准测试中有 14 个领先于 Kimi K3(一个 2.8T 参数的模型,最后一个测试几乎持平)!!很高兴看到他们保持了相同的价格,并且落在了 AA 智能与速度象限中最绿色的区域。