MiMo-v2.6-Pro:智能、性能与价格深度解析
MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis
Artificial Analysis 最新发布的 MiMo-v2.6-Pro 评测报告,通过 Intelligence Index v4.3.2 等十项严苛测试,全方位拆解了该模型的智能水平、性能表现与成本效益。报告不仅量化了模型在 Agentic knowledge work、SciCode 及医疗长上下文推理等场景的具体得分,还深入分析了 Openness Index、Token 消耗量及每任务成本。数据揭示了 MiMo-v2.6-Pro 在平衡推理能力与运行成本上的独特优势,为开发者在选型时提供了基于真实数据的决策依据,帮助你在复杂的模型矩阵中找到性价比最优解。
MiMo-v2.6-Pro 在每 Intelligence Index 任务上的加权平均成本,为开发者在追求高性能与低开销之间提供了极具吸引力的平衡点。
HN 评论区
29- Gareth321
OpenAI 的使用限额已被大幅削减,且智能水平似乎明显下降,所以我打算开始认真尝试这些中国模型了。我不介意响应时间长一点,我只需要智能表现能日复一日地稳定如一。
- egeres
MiMo-V2.6 Pro 在榜单上得分 46,而 DeepSeek-V4.1(https://artificialanalysis.ai/models/deepseek-v4-1-flash)只有 39,这感觉有点可疑。根据 https://mimo.xiaomi.com/mimo-v2-6 页面底部的附录,DeepSeek 模型在某些时候甚至能超越 MiMo,且能力差距并不大。就在上周,尽管 Fable 5 明显是更聪明的模型,Opus 5 却以 1 分的优势排在前面(这个问题后来已经修正了)。
- dom96
这是一个令人印象深刻的模型。我同意页面上写的大部分内容,除了“速度快”这一点。我在自己的 LLM 基准测试套件 [1] 上跑过,它确实比 DeepSeek 快,但依然远慢于领先模型。不过它的定价才是真正出彩的地方。
KillSwitch-Bench 1.0
Claude Opus 5 66.9
GPT-6 Astra 57.9
Claude Fable 5.1 46.7
MiMo-V2.6-Pro 38.8
Muse Spark 1.3 36.5