99ドルでLLMを評価? レトロなMUDが示した測定の落とし穴

Can a MUD evaluate LLMs? A $99 proof of concept

99ドルでLLMを評価? レトロなMUDが示した測定の落とし穴

研究段階のベンチマーク「CrucibleBench」は、LLMを永続的なMUD(テキストベースの仮想世界)に配置し、NPCが記憶し、信頼が蓄積され、失敗が痕跡を残す環境で、隠された社会的目標を50ターン以内に達成するかを評価する。フェーズ1の概念実証では、13モデル・650回の実行を99.59ドルで実施。LLMジャッジの構成要素を除去するとリーダーボードが最大6位変動し、従来の信頼性指標では検出できない測定上の不安定性が明らかになった。全650件のトランスクリプトとソースコード、課金データが公開されている。

我々はMUDを魅力的だから選んだのではない。その制約が行動を測定可能にするから選んだのだ。

この日のほかの記事

2026-07-22