MiMo-V2.6-Pro、Artificial Analysisの知能指数でトップクラスに

MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis

MiMo-V2.6-Pro、Artificial Analysisの知能指数でトップクラスに

Artificial AnalysisがMiMo-V2.6-Proの知能・性能・価格を分析。10種類の評価を組み合わせたIntelligence Index v4.3.2で、エージェント知識作業やコーディング、医療長文脈推論など幅広い能力を測定。オープンウェイトモデルとしての開放性や、タスクあたりのコスト、出力トークン数、速度、レイテンシ、コンテキストウィンドウも比較。価格対性能のバランスが明らかに。

AA-Omniscience Indexは知識の信頼性とハルシネーションを測定する。正解を報酬とし、ハルシネーションにペナルティを与え、回答拒否にはペナルティがない。スコアは-100から100の範囲で、0は正解と不正解が同数、負のスコアは不正解が正解より多いことを意味する。
  1. segmondy

    Mimo2.5は本当に良いが、私の好みではループしすぎる傾向があった。ローカルでは、Pro2.5はそれほど良いものではなかった。ワンショットなら使いたいと思う。v2.6で解決されていることを願う。多くの人が見逃しているモデルだ。使った人のほとんどは無料だから使っていたと分かった。まだ試したことがないなら、一考の価値があるトップモデルだ。

  2. Gareth321

    OpenAIの利用制限が大幅に削減され、知能も著しく低下しているようだから、本格的にこれらの中国製モデルを試し始めようと思う。時間がかかっても構わない。ただ、日々同じように予測可能に知能が機能してほしいだけだ。

  3. egeres

    MiMo-V2.6 Proが指数で46を獲得する一方、DeepSeek-V4.1(https://artificialanalysis.ai/models/deepseek-v4-1-flash)が39というのは怪しい気がする。https://mimo.xiaomi.com/mimo-v2-6 の下部にある付録によると、deepseekモデルは時々mimoを上回り、能力もそれほど遅れていない。一週間前、fableがはるかに賢いモデルであるにもかかわらず、opus 5がfable 5より1ポイント上に現れた(これはすでに修正されている)。

  4. dom96

    印象的なモデルだ。このページに書かれていることのほとんどに同意するが、速いという点は例外だ。自分のLLMベンチマークスイート[1]で実行したところ、DeepSeekよりは速いが、主要モデルよりはまだずっと遅い。しかし、価格設定が本当に光る点だ。

    KillSwitch-Bench 1.0

    Claude Opus 5 66.9

    GPT-6 Astra 57.9

    Claude Fable 5.1 46.7

    MiMo-V2.6-Pro 38.8

    Muse Spark 1.3 36.5

    1 - https://bench.killswitch-lang.org/

  5. tensegrist

    flashモデルはどこ?もう出てるんじゃないの

この日のほかの記事

2026-09-22