ИИ объясняет болезни — но именно объяснения могут сделать нас менее осторожными

Новое исследование показало: большие языковые модели помогают врачам и одновременно могут сильнее вводить в заблуждение обычных людей.

Мы привыкли считать, что если искусственный интеллект подробно объясняет свой вывод, значит ему можно доверять больше. Однако новое исследование Nature Medicine показывает неожиданную картину: именно самые понятные объяснения, созданные большими языковыми моделями (LLM), сильнее всего повышают риск слепого доверия у людей без медицинского образования. Врачи же используют эти же объяснения совершенно иначе — как дополнительную информацию, а не как замену собственному мышлению.

Пациентка изучает диагноз кожи на смартфоне, пока врач проверяет вывод медицинского ИИ по изображению и собственным записям
Один и тот же вывод ИИ может стать готовым ответом для пациента и лишь дополнительной гипотезой для опытного врача.

Когда проблема не в диагнозе, а в том, насколько убедительно он звучит

Большие языковые модели все чаще становятся частью медицины. Они анализируют изображения кожи, помогают формулировать диагнозы и объясняют, почему система пришла именно к такому выводу.

Интуитивно кажется, что это хорошо. Если компьютер не просто отвечает «это меланома», а объясняет ход своих рассуждений, человеку должно быть проще проверить правильность вывода.

Но исследование показало, что все оказывается сложнее.

Авторы называют такие объяснения «обоюдоострым мечом». Они действительно помогают. Но одновременно способны сделать человека менее критичным к ошибкам искусственного интеллекта.

Исследователи сравнили две совершенно разные аудитории

Авторы провели два крупных эксперимента.

В первом участвовали 623 человека без медицинского образования. Им показывали фотографии кожных образований и предлагали определить, является ли образование меланомой или доброкачественным невусом.

Во втором исследовании участвовали 153 врача первичной помощи. Их задача была значительно сложнее: необходимо было выбрать наиболее вероятный диагноз сразу среди нескольких кожных заболеваний.

Кроме того, исследователи отдельно протестировали еще 320 студентов-медиков, чтобы понять, как опыт влияет на взаимодействие с ИИ.

Один и тот же искусственный интеллект объяснял свои решения четырьмя способами

Исследователи сравнили несколько вариантов помощи:

  • только диагноз и вероятность правильности;
  • тепловую карту изображения (GradCAM), показывающую важные участки;
  • похожие клинические случаи (CBIR);
  • полноценное текстовое объяснение, созданное мультимодальной большой языковой моделью.

Именно последний вариант оказался самым интересным.

Вот где появляется главный психологический эффект

Когда ИИ давал правильный ответ, большие языковые модели действительно помогали людям.

Но когда ИИ ошибался, происходило почти зеркальное явление.

Люди начинали ошибаться вместе с ним.

Причем сильнее всего это происходило именно тогда, когда система сопровождала диагноз красивым и логичным текстовым объяснением.

Проще говоря, убедительное объяснение заставляло пользователей поверить даже неверному заключению.

Цифры оказались весьма показательными

У обычных участников исследования:

  • без помощи ИИ средняя точность составляла около 69,7%;
  • с помощью ИИ она выросла до 75,8%.

Однако эта прибавка зависела от того, был ли прав сам алгоритм.

Если ИИ был прав, текстовые объяснения LLM улучшали результаты сильнее остальных способов объяснения.

Но если ИИ ошибался, именно LLM вызывали самое большое падение точности диагностики — значительно сильнее, чем тепловые карты или демонстрация похожих случаев.

Самый неожиданный вывод исследования

Проблема оказалась вовсе не в качестве объяснений.

Даже объяснения, которые эксперты оценивали как менее качественные, продолжали убеждать людей.

Иными словами, человек доверял не потому, что объяснение действительно было хорошим.

Он доверял потому, что оно выглядело логичным и профессионально написанным.

Именно здесь возникает важный психологический механизм.

Почему текст убеждает сильнее картинки

Авторы предлагают интересное объяснение.

Тепловую карту необходимо интерпретировать самостоятельно.

Похожие изображения тоже требуют анализа.

А вот связный текст создает ощущение законченной истории.

Например:

«Образование выглядит подозрительным из-за неровных границ и неоднородной окраски…»

Такой рассказ воспринимается как полноценное медицинское рассуждение.

Возникает иллюзия понимания.

Человек начинает видеть на изображении именно те признаки, о которых только что прочитал.

Именно этот эффект авторы связывают с усилением автоматического доверия к ИИ.

Почему врачи реагировали совершенно иначе

Самое интересное произошло во второй части исследования.

Врачи тоже пользовались теми же объяснениями LLM.

Но их поведение оказалось принципиально другим.

Если искусственный интеллект ошибался, опытные врачи в большинстве случаев сохраняли собственное мнение и не следовали ошибочной рекомендации.

Более того, студенты-медики доверяли ИИ заметно чаще, чем практикующие врачи.

Профессиональный опыт становится своеобразным «когнитивным фильтром». Врач использует объяснение не для формирования мнения с нуля, а для проверки собственной гипотезы.

Это говорит о том, что профессиональный опыт становится своеобразным «когнитивным фильтром». Врач использует объяснение не для формирования мнения с нуля, а для проверки собственной гипотезы.

Еще один источник ошибок — когда ИИ говорит первым

Исследование проверило еще один важный вопрос.

Что лучше: сначала человек принимает решение, а потом смотрит мнение ИИ? Или наоборот?

Оказалось, что если сначала показать рекомендацию искусственного интеллекта, возникает более сильный эффект «якоря».

Первая полученная информация начинает незаметно влиять на дальнейшие рассуждения.

Даже у врачей такой порядок повышал склонность соглашаться с системой чаще, чем если они сначала принимали собственное решение.

Что это меняет для будущих медицинских ИИ

Главный вывод исследования нельзя свести к простой фразе «LLM опасны».

Наоборот.

Авторы показывают, что современные системы действительно повышают точность диагностики и даже уменьшают различия в качестве диагностики пациентов с разным цветом кожи благодаря специально обученной модели ИИ. Но эффективность таких систем зависит не только от самого алгоритма, а и от того, кому, как и в какой момент показывают его рекомендации.

Для обычных пользователей безопаснее проектировать интерфейсы так, чтобы они подчеркивали неопределенность и не создавали ощущения абсолютной уверенности.

Для врачей же оптимальной выглядит модель, при которой специалист сначала формирует собственное мнение и лишь затем знакомится с выводом искусственного интеллекта.

Синтез от АПТЕКИУМ: Главная опасность медицинского ИИ сегодня заключается не столько в его ошибках, сколько в том, насколько убедительно он умеет их объяснять. Хорошее объяснение должно помогать человеку думать, а не заменять его собственное критическое мышление.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.