Ein $99-Proof-of-Concept zeigt: MUDs können LLMs besser bewerten als statische Benchmarks

Can a MUD evaluate LLMs? A $99 proof of concept

Ein $99-Proof-of-Concept zeigt: MUDs können LLMs besser bewerten als statische Benchmarks

CrucibleBench setzt Sprachmodelle in eine persistente MUD-Welt, in der NPCs sich erinnern, Vertrauen aufbauen und Fehler Spuren hinterlassen. In 50 Zügen müssen die Modelle versteckte soziale Ziele erreichen. Die Phase-1-Studie mit 13 Modellen und 650 Läufen kostete nur 99,59 US-Dollar. Der zentrale Befund: Ein LLM-Judge in der Bewertungspipeline veränderte die Rangliste um bis zu sechs Plätze, während alle Aggregat-Kennzahlen stabil blieben. Die Autoren fordern, dass Benchmarks mit LLM-Judges die Übereinstimmung pro Subjekt und die Ranking-Stabilität unter Judge-Ablation berichten. Verhaltensfehler wie Dialog-Loops und falsche Raum-Interaktionen wurden algorithmisch erkannt.

Wir haben uns nicht für einen MUD entschieden, weil er charmant ist, sondern weil seine Beschränkungen Verhalten messbar machen.

Mehr von diesem Tag

2026-07-22