LLM-судьи не замечают пропусков в ИИ-медзаписях: как это исправить
LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes
Исследователи из ComposoAI создали бенчмарк OmissionBench для проверки способности LLM-судьев обнаруживать пропуски в клинических заметках, созданных ИИ-секретарями. Оказалось, что стандартные методы оценки хорошо выявляют добавленные или измененные факты (точность 0.79–0.94), но почти не замечают отсутствующие (0.50–0.63, что близко к случайности). Однако реструктуризация задачи — сначала перечислить факты из транскрипта, затем проверить каждый в заметке — восстанавливает детекцию. Два метода (пофактовый конвейер и однократный вызов с эволюционированным промптом) достигают успеха, причем второй обнаруживает больше пропусков (36.9% против 24.6%) при приемлемом уровне ложных срабатываний (6.2%). Врачи-эксперты подтвердили корректность оценок. Пропуски, где факт упоминается в другом месте заметки, остаются нерешенной проблемой.
На одиночных заметках ни один дизайн не выявляет пропуски надежно чаще, чем идеальные заметки.
- Planktonne
Тот факт, что даже аннотация явно сгенерирована ИИ, не вселяет в меня уверенности в строгости исследования.
- velrim
Не уверен насчёт статьи, но результаты имеют смысл — мы видим то же самое при извлечении PDF. Поля, которых нет в документе, выдумываются в 11–40% случаев в зависимости от API. Вся эта ситуация неприятна, отчасти потому, что это не только проблема ИИ. Когда мы проверяли человеческие разметки, использованные в наших оценках, 40 из 142 ключей ответов, утверждавших отсутствие, были ошибочными. Сложный случай.
- udik2
Возможно, написано ИИ. Использовал свой ИИ, чтобы уловить суть. Одна вещь, в которую я верю: к LLM нужно относиться как к чисто инструментальному средству, и их можно направлять на выявление пропусков. Причина проста: чтобы найти недостающее, нужно задать правильные вопросы о том, как оценивать, и когда это есть.