Mercury 2.5、毎秒770トークンでLLMの速度記録を更新

Mercury 2.5 LLM hits 770 tokens per second

Mercury 2.5、毎秒770トークンでLLMの速度記録を更新

Artificial Analysisの分析によると、Mercury 2.5は出力速度毎秒770トークンを達成し、LLMの性能限界を押し広げた。インテリジェンス指数v4.3.2では10種類の評価を統合し、知識の信頼性と幻覚を測るAA-Omniscience Indexも導入。コスト効率とコンテキストウィンドウも詳細に分析され、高速推論の新基準を提示している。

AA-Omniscience Indexは知識の信頼性と幻覚を測定する。正解には報酬を与え、幻覚にはペナルティを課し、回答を拒否してもペナルティはない。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が正解より多いことを示す。
  1. bearjaws

    速度を気にするなら、Cerebrasのgpt-oss-120bは1400tk/sで、ランキングでも「同じくらい賢い」んだよね。

    いくつかの遊びのプロジェクトで使ってみたけど、まあまあって感じ。でも速度は見ててヤバい。

  2. the_arun

    Chat Jimmyは毎秒17Kトークンで、LLMをチップに焼き込んでる - https://chatjimmy.ai/ - ソース: https://theashishmaurya.medium.com/taalas-the-startup-that-p...

  3. jjcm

    https://chatjimmy.ai/ みたいな新しいTaalasスタイルのチップがまだ出てこないのが残念でならない。今は小さいモデルでも十分良いから、あの狂ったようなトークンの爆発がすごく役立つんだよね。

  4. nextaccountic

    ある時点でボトルネックはツール呼び出しになる.. だからこそ、モデルは自分のコードリポジトリや必要な参照/コンテキストすべて(ほとんどのエコシステムの完全なドキュメント、ウェブフェッチの使用を最小限にするためのCommon Crawlのコピーとか)と同じ場所(少なくとも同じデータセンター内)で共同ホストされているのが望ましい。

  5. freakynit

    Mercury 2.5をたくさんのタスクで使ってみた.. でもこのモデルはまだそこまでじゃない。最大でどんな14Bモデルと同等って感じ。自分で使ってみた限りでは、GPT-OSS-20Bの方がずっと性能が良い。

    信じられない速度と価格の組み合わせを提供してくれるから、本当に本当に使いたかった。でもダメ.. まだ使ってない.. 基本的なタスクにすら使ってない。

この日のほかの記事

2026-09-23