MiMo-V2.6-Pro、Artificial Analysisの知能指数でトップクラスに
MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis
Artificial AnalysisがMiMo-V2.6-Proの知能・性能・価格を分析。10種類の評価を組み合わせたIntelligence Index v4.3.2で、エージェント知識作業やコーディング、医療長文脈推論など幅広い能力を測定。オープンウェイトモデルとしての開放性や、タスクあたりのコスト、出力トークン数、速度、レイテンシ、コンテキストウィンドウも比較。価格対性能のバランスが明らかに。
AA-Omniscience Indexは知識の信頼性とハルシネーションを測定する。正解を報酬とし、ハルシネーションにペナルティを与え、回答拒否にはペナルティがない。スコアは-100から100の範囲で、0は正解と不正解が同数、負のスコアは不正解が正解より多いことを意味する。
HNでの議論
60- segmondy
Mimo2.5は本当に良いが、私の好みではループしすぎる傾向があった。ローカルでは、Pro2.5はそれほど良いものではなかった。ワンショットなら使いたいと思う。v2.6で解決されていることを願う。多くの人が見逃しているモデルだ。使った人のほとんどは無料だから使っていたと分かった。まだ試したことがないなら、一考の価値があるトップモデルだ。
- Gareth321
OpenAIの利用制限が大幅に削減され、知能も著しく低下しているようだから、本格的にこれらの中国製モデルを試し始めようと思う。時間がかかっても構わない。ただ、日々同じように予測可能に知能が機能してほしいだけだ。
- egeres
MiMo-V2.6 Proが指数で46を獲得する一方、DeepSeek-V4.1(https://artificialanalysis.ai/models/deepseek-v4-1-flash)が39というのは怪しい気がする。https://mimo.xiaomi.com/mimo-v2-6 の下部にある付録によると、deepseekモデルは時々mimoを上回り、能力もそれほど遅れていない。一週間前、fableがはるかに賢いモデルであるにもかかわらず、opus 5がfable 5より1ポイント上に現れた(これはすでに修正されている)。
- dom96
印象的なモデルだ。このページに書かれていることのほとんどに同意するが、速いという点は例外だ。自分のLLMベンチマークスイート[1]で実行したところ、DeepSeekよりは速いが、主要モデルよりはまだずっと遅い。しかし、価格設定が本当に光る点だ。
KillSwitch-Bench 1.0
Claude Opus 5 66.9
GPT-6 Astra 57.9
Claude Fable 5.1 46.7
MiMo-V2.6-Pro 38.8
Muse Spark 1.3 36.5
- tensegrist
flashモデルはどこ?もう出てるんじゃないの