MUD로 LLM을 평가할 수 있을까? 99달러 실증 실험
Can a MUD evaluate LLMs? A $99 proof of concept

CrucibleBench는 LLM을 영속적인 MUD(멀티유저 던전) 세계에 배치하여 50턴 동안 숨겨진 사회적 목표를 달성하는 행동을 평가하는 연구용 벤치마크입니다. NPC는 기억하고, 신뢰는 누적되며, 실수는 흔적으로 남습니다. 1단계 개념 증명에서는 13개 모델, 650회 실행, 총 $99.59의 비용으로 데이터를 수집했습니다. 가장 일반화 가능한 발견은 채점 파이프라인에서 LLM 심판(judge) 구성 요소를 제거했을 때 리더보드 순위가 최대 6단계까지 바뀌었다는 점입니다. 이는 집계 신뢰도 지표(κ=0.04)로는 드러나지 않는 불안정성으로, LLM 심판을 사용하는 벤치마크는 주제별 일치도와 심판 제거 시 순위 안정성을 보고해야 함을 시사합니다. 전체 650개 대화 기록과 소스 코드, 청구 내역이 공개되어 있습니다.
우리는 MUD가 매력적이어서 선택한 것이 아니라, 그 제약 덕분에 행동을 측정할 수 있기 때문에 선택했습니다.