Исследование MIT выявило разную реакцию врачей и новичков на объяснения ИИ

Исследователи MIT, Стэнфордского и Колумбийского университетов проверили, как врачи первичного звена и люди без медицинской подготовки используют ИИ при диагностике кожных заболеваний. Помощь моделей в целом повысила точность обеих групп, однако объяснения на основе больших языковых моделей по-разному влияли на их решения.
Новички чаще принимали рекомендации системы без критической проверки — даже когда ИИ ошибался. Врачи, напротив, распознавали неверные подсказки и показали лучший результат, когда получали только прогноз модели без сопроводительного объяснения. Работа опубликована в Nature Medicine.
Какие интерфейсы сравнили исследователи
Участникам показывали медицинские изображения и прогноз ИИ. В разных вариантах интерфейс сообщал прогноз и уровень уверенности без объяснения, подбирал похожие изображения, выделял значимые области тепловой картой либо формулировал рассуждение простым языком с помощью LLM.
Люди без подготовки определяли, является ли родинка злокачественной. Врачам поставили более сложную задачу: составить дифференциальный диагноз дерматологического заболевания. Все способы объяснения повысили точность новичков, главным образом помогая им распознавать доброкачественные образования.
Модель с ограничениями справедливости, созданная для снижения предвзятости в отношении тёмных оттенков кожи, заметно повысила точность и сократила различия результатов, связанные с тоном кожи.
Почему понятное объяснение не всегда помогает
Улучшение результатов новичков в значительной степени объяснялось их зависимостью от модели. Ошибочная рекомендация вредила им сильнее, чем правильная помогала. Эффект оказался наиболее выраженным при использовании LLM: участники становились увереннее даже в неверных ответах, а расплывчатые и общие формулировки казались им более убедительными.
Врачи сопоставляли подсказку с собственными знаниями и поэтому чаще замечали ошибку. Среди исследованных методов языковые модели дали им наименьший прирост точности. Результат показывает, что одно и то же объяснение может поддерживать эксперта, но формировать ошибочное мнение у человека без профильной подготовки.
Как снизить автоматическое доверие
Сильнее всего полагались на ИИ те участники, которые хуже справлялись без него. Важным оказался и порядок действий: если объяснение появлялось до самостоятельной оценки, пользователи чаще соглашались с моделью.
ИИ превосходил людей, когда признаки заболевания были едва заметны. Люди работали лучше при нетипичных симптомах или наличии на изображении посторонних особенностей. Поэтому авторы предлагают сначала просить пользователя сформулировать собственную диагностическую гипотезу и лишь затем показывать предложение ИИ с альтернативными вариантами.
Практический вывод для бизнеса: медицинский ИИ нельзя внедрять через единый интерфейс для всех групп. Уровень подготовки пользователя, порядок показа рекомендаций и устойчивость к ошибкам модели необходимо проверять отдельно. Объяснение должно стимулировать критическую оценку, а не превращать уверенный текст системы в замену профессионального решения.

