99美元MUD测试:LLM社交能力大起底
Can a MUD evaluate LLMs? A $99 proof of concept

CrucibleBench 将大语言模型投入一个持久的 MUD 文字世界,通过 50 轮互动评估其社交行为。在这个世界里,NPC 会记住你的行为,信任需要积累,错误会留下痕迹。仅花费 99 美元,团队完成了 13 个模型共 650 次运行。研究发现,依赖 LLM 作为裁判会剧烈改变排名,而对话循环、错误房间交互和探索瘫痪是主要失败模式。这证明了利用成熟技术约束来测量 AI 行为的有效性,而非追求高成本的光影仿真。
我们选择 MUD 并非因为它迷人,而是因为它的约束让行为变得可测量。
HN 评论区
77- Varelion
有点跑题,但我得吐槽一下跟 MUD 沾边的东西。
我真的希望 MUD 还能火起来。那些基于文本的角色扮演社区基本上被 Discord 吞并了,以前它们散落在 proboards、jcink 等几个地方。
Discord 作为一个不完美的文本平台,限制了文本功能,导致大部分互动都受限于尴尬的格式。更糟糕的是,即使出现了更好的生态系统,玩家也拒绝尝试,哪怕是被直接邀请,因为他们已经习惯了 Discord 的糟糕体验。
这太让人沮丧了,我不知道该怎么表达,甚至不知道能做些什么。
- dataviz1000
> 每个 LLM 的测量数据
我觉得你的思路是对的。
如果你让 LLM 在不使用代码工具的情况下通过推理解决乘法问题,根据模型不同,它能正确计算出 15 位(15D)乘以 15 位的乘法(123456789012345 x 998765432109876)。如果是 Sonnet 模型,这需要 4000 到 8000 个 token。随着位数增加,最终它会开始只在 80% 的情况下解出……然后是 70%,直到位数多到它永远解不出来。会有一个特定的位数,它既无法收敛到解,也不会停止尝试(以为自己能解出来)。这非常、非常昂贵。要确定它能解出的概率,需要运行很多次。
你现在能做的,而且这可能是最重要的一点,就是调整提示词(prompt),评估完成任务需要多少 token 以及速度如何。当然,每个 LLM 的测量数据很重要!不过,如果你能告诉一家公司,你有一种优化提示词并评估它们的技术,让他们每天不再花费 $1 x 100,000,而是只需花费 $0.90 x 100,000,那你就能赚大钱。
- krzyk
我有点担心 MUD 是别的缩写,点进来时只有 10% 的希望这是关于多人地牢(multi user dungeons)的,结果真的是,谢天谢地。读起来很有趣。
这让我想起了当年我们在大学几个系里到处找免费终端,只为能连上网的经历。
- rufasterisco
我让智能体在一个(仍然活跃、有人类玩家)的 MUD 里玩耍和理解,玩得不亦乐乎,我自己也在这个 MUD 里玩了 30 年。
这主要是我用来玩本地 LLM 推理的方式(m5 64gb, gwen3.6 27)。
太神奇了。它们会绘制地图,对事件进行分类(为解析器构建语法),还会运行实验(验证语法)。
现在(在拥有正确的工具/基础设施的情况下),它们正试图微调一个 3b 模型用于战斗(这种战斗需要在 5 秒的回合内做出决策)。基本上是完全自动化的!
总的来说,MUD 确实为它们提供了一个绝佳的受限沙盒来玩耍。
起初这只是一个测试本地推理的实验,结果却意外地成为了观察模型优势、劣势和权衡的绝佳切入点。而且真的很有趣。
唯一的问题是,当我让 Claude 帮我写代码来运行本地推理的 po harness 时,它显得特别嫉妒。真是奇怪的世界。
- gverrilla
我青少年时期试过几次 MUD,但不知为何不太喜欢。我更喜欢在一个早已消亡的 phpBB 论坛(LdC)上玩 RPG,直到今天我还记得当时非常简单的机制(对玩家和 GM 都是如此):用星号(*)表示角色对话,用井号(#)表示其他所有内容。
单条帖子可能长这样:
# 听到那些荒谬的言论,维森特·潘克拉斯特(Vicent Panclast)的脑海中涌起回忆
——那些他想要回避的回忆。他身体变得焦躁,高高举起了手枪。
* 他们休想通过!我们必须不惜一切代价阻止
这些该死的纳粹!!
据我回忆,当时完全没有骰子——GM 想怎么来就怎么来。你的角色卡只是角色的故事加上一些描述。我们有个超棒的 GM,所以玩起来非常精彩。好时光啊。
我不禁好奇,如果今天能恰当地利用 AI,类似的东西会变成什么样。我希望现在的孩子们也在探索这类东西——希望他们确实在玩,因为这真的非常有趣(哪怕没有 AI,孩子们玩起来也超开心)。