Prime Intellect、18の最先端モデルでnanoGPT最適化スピードランを競わせ、Fable 5が記録を樹立
NanoGPT Speedrun Frontier

Prime Intellectは、nanoGPTの最適化スピードランにおいて、18の最先端モデル(Fable 5、Opus 5、Kimi K3、GPT-5.6など)による153回の自律実行を実施しました。各モデルは、claude-codeやcodexなどのハーネスを用いて、最適なトレーニング設定を自律的に探索します。結果、Fable 5が記録2,726(ベースライン3,290に対して81.7%のギャップを縮小)を達成し、Opus 5、Kimi K3が続きました。また、等予算比較では、Fable 5が24時間の予算内で3,010を記録し、人間のベースライン2,600を上回りました。全41のトレースが公開され、自律研究の可能性を示しています。
Fable 5は、自律エージェントが人間の研究者を超える可能性を示す、記録2,726を達成しました。
HNでの議論
38- lhl
トレーニング面で見るとかなり興味深い。私はこれらのモデルのほとんどを、カーネル最適化のために(数日単位で)半自律的に使ってきた(Fableは除く。あれはすぐにガードレールを発動して、当時はOpus 4.8に切り替えざるを得なかった)。多くの人にとって、それが最大の問題かもしれないが、Opus 5はそれでも良い成績を残しているようだ。
指示なしで放置すると、モデル(特にGPT系)は同じところをぐるぐる回ってしまうが、適切な足場があればかなりうまく機能するようだ。私の一般的なループは、まずアイデア出しとプロファイリングの段階から始め、実行回数を制限してからリストの次の項目に強制的に進み、その後「新鮮な目」でモデルを混ぜながら反復するというものだ。これは完全に自動化できるかもしれないが、私は1日1回くらいチェックして、何が起きているかを見て方向を修正するのが好きだ。
- vibe42
「ほとんどすべてのモデルが同じ勝利のアイデアを見つける。最高のトレースを分けるのは、実験が何を残すかだ。彼らは弱いシグナルを検証するのに十分な長さ保持するが、結果をよりよく理解している。」
履歴ログでシグナルを保持するハーネスがあれば、結果が変わっていたかどうか興味がある。
また、異なるゴールプロンプトがあれば結果が変わっていたかどうかも興味がある。大量のプロンプトエンジニアリングではなく、「斬新な解決策を検討し、弱いシグナルを追跡する」のような小さな違いだ。
個人的には、彼らはかなりのGPU時間を同じゴールプロンプトに割り当てたと思う。
- nsingh2
solはどうなっているんだ? メモによると待ち時間が多いらしいが、単に時間を効果的に使っていない(並列実行のようなもの)せいで、グラフが時間軸で引き伸ばされているのか?
また、Opus 5のメモには、プログラム.mdの古いシリアル版を使った実行だったとあり、グラフが完全な比較になっていないという点も見られる。
編集:ブログがこれらの点に触れているようだ https://www.primeintellect.ai/blog/measuring-autonomous-rese...
- totetsu
「私たちは、nanoGPTオプティマイザースピードランで、18の最先端モデルを使って153回の自律実行を行いました。」
えっと…まあいいけど…「実行」って何だ? ブログを読もう。
「私たちは、最先端モデルが研究をどれだけうまく実行できるかを測定したいと考えています…」
「私たちは、nanoGPTオプティマイザースピードランで、18の最先端モデルを使って153回の自律実行を行いました。」
わかったけど、オプティマイザーランとは何で、それが研究が得意であることとどう関係するんだ?
「比較として、Anthropicの社内自動AI研究開発評価は、CPUノード上でモデルを最適化しています。」
だから、Anthropicが何をしていたかを見に行けばいいのか?
なぜブログでその意味を説明しないんだ?
- espadrine
3つ目のX軸としてドルがあれば興味深い。
時間は、モデルの品質よりも推論インフラ(特にシストリックチップ)に関係することがあり(プロバイダーはレイテンシを犠牲にしてバッチを高くするためにノブを調整する)、
トークンはモデル間で常に完全に同等とは限らない。