LLM-судьи не замечают пропусков в ИИ-медзаписях: как это исправить

LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes

Исследователи из ComposoAI создали бенчмарк OmissionBench для проверки способности LLM-судьев обнаруживать пропуски в клинических заметках, созданных ИИ-секретарями. Оказалось, что стандартные методы оценки хорошо выявляют добавленные или измененные факты (точность 0.79–0.94), но почти не замечают отсутствующие (0.50–0.63, что близко к случайности). Однако реструктуризация задачи — сначала перечислить факты из транскрипта, затем проверить каждый в заметке — восстанавливает детекцию. Два метода (пофактовый конвейер и однократный вызов с эволюционированным промптом) достигают успеха, причем второй обнаруживает больше пропусков (36.9% против 24.6%) при приемлемом уровне ложных срабатываний (6.2%). Врачи-эксперты подтвердили корректность оценок. Пропуски, где факт упоминается в другом месте заметки, остаются нерешенной проблемой.

На одиночных заметках ни один дизайн не выявляет пропуски надежно чаще, чем идеальные заметки.
  1. Planktonne

    Тот факт, что даже аннотация явно сгенерирована ИИ, не вселяет в меня уверенности в строгости исследования.

  2. velrim

    Не уверен насчёт статьи, но результаты имеют смысл — мы видим то же самое при извлечении PDF. Поля, которых нет в документе, выдумываются в 11–40% случаев в зависимости от API. Вся эта ситуация неприятна, отчасти потому, что это не только проблема ИИ. Когда мы проверяли человеческие разметки, использованные в наших оценках, 40 из 142 ключей ответов, утверждавших отсутствие, были ошибочными. Сложный случай.

  3. udik2

    Возможно, написано ИИ. Использовал свой ИИ, чтобы уловить суть. Одна вещь, в которую я верю: к LLM нужно относиться как к чисто инструментальному средству, и их можно направлять на выявление пропусков. Причина проста: чтобы найти недостающее, нужно задать правильные вопросы о том, как оценивать, и когда это есть.

Ещё за этот день

2026-09-02