LLM 裁判的盲区:AI 病历中的遗漏

LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes

Ambient AI 医生记录员在撰写临床笔记时,最常见的错误是遗漏关键信息。我们测试了八种 LLM 裁判方案,发现它们能精准识别内容被添加或篡改的情况,却对“遗漏”视而不见,准确率仅略高于随机猜测。研究指出,标准验证方法存在“遗漏盲视”。通过将任务重构为“先列出事实再逐一核对”,两种新方法成功解决了这一问题。其中,单次调用的 GEPA 优化方案在成本降低十倍的情况下,检测率显著提升,且经医生验证,其准确性与分步流水线方案相当。该研究揭示了当前 AI 审计的局限,并提供了切实可行的改进路径。

LLM 裁判只能验证信息的存在,却无法察觉信息的缺失:这就是 AI 临床笔记中的遗漏盲视。
  1. Planktonne

    连摘要都明显是 AI 生成的,这让我对这项研究的严谨性毫无信心。

  2. velrim

    论文本身我不太确定,但结果很合理,我们在 PDF 提取中也见过类似情况。根据 API 不同,文档中不存在的字段有 11% 到 40% 的概率被凭空捏造出来。

    这事很糟糕,部分原因在于这不仅仅是 AI 的问题。当我们检查评估中用到的人工标注时,142 个答案键中竟有 40 个声称“不存在”的标注是错误的。这确实是个棘手的问题。

  3. udik2

    可能是 AI 写的。我用 AI 快速浏览了一下大意。有一点我相信:LLM 应该被视为纯粹的工具,只要引导得当,它也能指出遗漏之处。原因很简单:要想发现缺失了什么,关键在于提出正确的问题,明确判断标准和时机。

同日更多故事

2026-09-02