Mercury 2.5、毎秒770トークンでLLMの速度記録を更新
Mercury 2.5 LLM hits 770 tokens per second
Artificial Analysisの分析によると、Mercury 2.5は出力速度毎秒770トークンを達成し、LLMの性能限界を押し広げた。インテリジェンス指数v4.3.2では10種類の評価を統合し、知識の信頼性と幻覚を測るAA-Omniscience Indexも導入。コスト効率とコンテキストウィンドウも詳細に分析され、高速推論の新基準を提示している。
AA-Omniscience Indexは知識の信頼性と幻覚を測定する。正解には報酬を与え、幻覚にはペナルティを課し、回答を拒否してもペナルティはない。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が正解より多いことを示す。
HNでの議論
54- bearjaws
速度を気にするなら、Cerebrasのgpt-oss-120bは1400tk/sで、ランキングでも「同じくらい賢い」んだよね。
いくつかの遊びのプロジェクトで使ってみたけど、まあまあって感じ。でも速度は見ててヤバい。
- the_arun
Chat Jimmyは毎秒17Kトークンで、LLMをチップに焼き込んでる - https://chatjimmy.ai/ - ソース: https://theashishmaurya.medium.com/taalas-the-startup-that-p...
- jjcm
https://chatjimmy.ai/ みたいな新しいTaalasスタイルのチップがまだ出てこないのが残念でならない。今は小さいモデルでも十分良いから、あの狂ったようなトークンの爆発がすごく役立つんだよね。
- nextaccountic
ある時点でボトルネックはツール呼び出しになる.. だからこそ、モデルは自分のコードリポジトリや必要な参照/コンテキストすべて(ほとんどのエコシステムの完全なドキュメント、ウェブフェッチの使用を最小限にするためのCommon Crawlのコピーとか)と同じ場所(少なくとも同じデータセンター内)で共同ホストされているのが望ましい。
- freakynit
Mercury 2.5をたくさんのタスクで使ってみた.. でもこのモデルはまだそこまでじゃない。最大でどんな14Bモデルと同等って感じ。自分で使ってみた限りでは、GPT-OSS-20Bの方がずっと性能が良い。
信じられない速度と価格の組み合わせを提供してくれるから、本当に本当に使いたかった。でもダメ.. まだ使ってない.. 基本的なタスクにすら使ってない。