Mozilla.ai, ACM FAccT에서 LLM 가드레일도 모델만큼 엄격히 평가해야 한다고 주장하다

From Evaluation to Guardrails: What We Brought to ACM FAccT 2026

Mozilla.ai, ACM FAccT에서 LLM 가드레일도 모델만큼 엄격히 평가해야 한다고 주장하다

Mozilla.ai는 ACM FAccT 2026에서 LLM 가드레일의 평가가 모델 평가만큼 중요하다는 주장을 내세웠다. 팀은 난민 및 망명 관련 시나리오 120개를 영어, 페르시아어, 아랍어, 쿠르드어(소라니), 파슈토어로 평가하고, 실패 사례를 바탕으로 가드레일 정책을 수립했다. 그러나 텍스트만으로는 사실성과 실행 가능성을 판단할 수 없다는 한계를 발견하고, 웹 검색과 같은 도구를 갖춘 에이전틱 가드레일을 제안했다. 실습 세션에서 35명의 참가자가 에이전틱 및 비에이전틱 평가를 비교했으며, 도구 사용이 최종 판정보다 증거를 바꾸는 데 더 큰 영향을 미쳤다. 또한 가드레일 교체를 쉽게 해주는 오픈소스 도구 any-guardrail과 LLM 게이트웨이 Otari를 소개했다.

가드레일을 평가하는 것은 가드레일이 보호하는 LLM을 평가하는 것만큼 중요하며, 상황 및 언어별 평가 결과는 정적인 유해성 분류 체계를 넘어 동적 정책으로 나아가는 가드레일에 반영되어야 한다.

이 날의 다른 글

2026-07-23