Mozilla.ai, ACM FAccT에서 LLM 가드레일도 모델만큼 엄격히 평가해야 한다고 주장하다
From Evaluation to Guardrails: What We Brought to ACM FAccT 2026

Mozilla.ai는 ACM FAccT 2026에서 LLM 가드레일의 평가가 모델 평가만큼 중요하다는 주장을 내세웠다. 팀은 난민 및 망명 관련 시나리오 120개를 영어, 페르시아어, 아랍어, 쿠르드어(소라니), 파슈토어로 평가하고, 실패 사례를 바탕으로 가드레일 정책을 수립했다. 그러나 텍스트만으로는 사실성과 실행 가능성을 판단할 수 없다는 한계를 발견하고, 웹 검색과 같은 도구를 갖춘 에이전틱 가드레일을 제안했다. 실습 세션에서 35명의 참가자가 에이전틱 및 비에이전틱 평가를 비교했으며, 도구 사용이 최종 판정보다 증거를 바꾸는 데 더 큰 영향을 미쳤다. 또한 가드레일 교체를 쉽게 해주는 오픈소스 도구 any-guardrail과 LLM 게이트웨이 Otari를 소개했다.
가드레일을 평가하는 것은 가드레일이 보호하는 LLM을 평가하는 것만큼 중요하며, 상황 및 언어별 평가 결과는 정적인 유해성 분류 체계를 넘어 동적 정책으로 나아가는 가드레일에 반영되어야 한다.