AI 护栏需像模型一样接受审视
From Evaluation to Guardrails: What We Brought to ACM FAccT 2026

在 ACM FAccT 2026 会议上,我们展示了 AI 护栏不应只是静态策略,而需像模型一样接受严格评估。通过针对难民和庇护场景的多语言测试,我们发现仅靠文本无法判断事实性,必须引入 web search 等工具。Mozilla.ai 推出的 agentic guardrail 结合工具调用,显著提升了判断的可靠性。从评估到护栏的闭环,才是构建可信 AI 系统的关键。
评估护栏与评估 LLM 模型本身同样重要,基于语境和语言的评估结果应推动护栏从静态伤害分类转向动态策略。