99美元MUD测试:LLM社交能力大起底
Can a MUD evaluate LLMs? A $99 proof of concept

CrucibleBench 将大语言模型投入一个持久的 MUD 文字世界,通过 50 轮互动评估其社交行为。在这个世界里,NPC 会记住你的行为,信任需要积累,错误会留下痕迹。仅花费 99 美元,团队完成了 13 个模型共 650 次运行。研究发现,依赖 LLM 作为裁判会剧烈改变排名,而对话循环、错误房间交互和探索瘫痪是主要失败模式。这证明了利用成熟技术约束来测量 AI 行为的有效性,而非追求高成本的光影仿真。
我们选择 MUD 并非因为它迷人,而是因为它的约束让行为变得可测量。