LLM 裁判的盲区:AI 病历中的遗漏
LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes
Ambient AI 医生记录员在撰写临床笔记时,最常见的错误是遗漏关键信息。我们测试了八种 LLM 裁判方案,发现它们能精准识别内容被添加或篡改的情况,却对“遗漏”视而不见,准确率仅略高于随机猜测。研究指出,标准验证方法存在“遗漏盲视”。通过将任务重构为“先列出事实再逐一核对”,两种新方法成功解决了这一问题。其中,单次调用的 GEPA 优化方案在成本降低十倍的情况下,检测率显著提升,且经医生验证,其准确性与分步流水线方案相当。该研究揭示了当前 AI 审计的局限,并提供了切实可行的改进路径。
LLM 裁判只能验证信息的存在,却无法察觉信息的缺失:这就是 AI 临床笔记中的遗漏盲视。
HN 评论区
10- Planktonne
连摘要都明显是 AI 生成的,这让我对这项研究的严谨性毫无信心。
- velrim
论文本身我不太确定,但结果很合理,我们在 PDF 提取中也见过类似情况。根据 API 不同,文档中不存在的字段有 11% 到 40% 的概率被凭空捏造出来。
这事很糟糕,部分原因在于这不仅仅是 AI 的问题。当我们检查评估中用到的人工标注时,142 个答案键中竟有 40 个声称“不存在”的标注是错误的。这确实是个棘手的问题。
- udik2
可能是 AI 写的。我用 AI 快速浏览了一下大意。有一点我相信:LLM 应该被视为纯粹的工具,只要引导得当,它也能指出遗漏之处。原因很简单:要想发现缺失了什么,关键在于提出正确的问题,明确判断标准和时机。