Un MUD de $99 para evaluar LLMs: la prueba de concepto que reordena los rankings
Can a MUD evaluate LLMs? A $99 proof of concept

CrucibleBench es un benchmark en fase de investigación que sitúa a los modelos de lenguaje en un MUD persistente, un mundo de texto donde los NPCs recuerdan, la confianza se acumula y los errores dejan rastro. Los agentes deben completar objetivos sociales ocultos en 50 turnos. La prueba de concepto, lanzada con 13 modelos y 650 ejecuciones por solo $99,59, revela un hallazgo central: un único componente de juez LLM dentro del sistema de puntuación reordenó la clasificación hasta en seis posiciones, mientras que las métricas agregadas de fiabilidad permanecieron estables. El proyecto documenta modos de fallo como el bucle de diálogo y la parálisis de exploración, y aboga por auditar a los jueces LLM por sujeto.
No elegimos un MUD porque sea encantador; lo elegimos porque sus restricciones hacen que el comportamiento sea medible.