ИИ не успокаивал тревогу — он помогал делать то, чего человек избегал

Одна гибридная сессия с GenAI снизила учебную тревогу и прокрастинацию, но не улучшила «психическое здоровье вообще»

Исследователи проверили необычный сценарий применения генеративного ИИ: не свободную беседу «с цифровым психологом», а строго структурированную экспозиционную практику. В двух рандомизированных исследованиях с 425 студентами гибридная программа «человек + GPT-4o» сильнее контрольных условий уменьшала именно те проблемы, на которые была направлена: учебную тревогу и прокрастинацию. Но широкого преимущества по генерализованной тревоге и депрессивным симптомам не обнаружили — и именно эта специфичность результата, возможно, является главным выводом работы.

Студент в университетской библиотеке работает за ноутбуком во время сложной учебной задачи; смартфон рядом символизирует ИИ при учебной тревоге
Экспозиция работает не через избегание тревоги, а через продолжение действия несмотря на неё — именно эту процедуру помогал поддерживать ИИ.

ИИ здесь был не психологом, а частью процедуры

Когда обсуждают генеративный ИИ и психическое здоровье, разговор часто сводится к крайностям. Либо чат-бот скоро заменит психотерапевта, либо языковая модель в принципе не способна принести терапевтическую пользу.

Исследование команды из Tsinghua University и других университетов предлагает гораздо более интересный третий вариант: ИИ может выполнять ограниченную и заранее определённую часть психологического вмешательства.

Авторы выбрали экспозиционную терапию — один из наиболее хорошо изученных подходов к лечению тревожных расстройств. Её центральная идея на первый взгляд парадоксальна: человеку предлагают не избегать вызывающей тревогу ситуации, а безопасно и контролируемо сталкиваться с ней.

В исследовании речь шла не о тяжёлых клинических тревожных расстройствах, а об учебной тревоге — тревоге, связанной с учёбой. Участниками были студенты китайских университетов с повышенным уровнем такой тревоги.

Программа занимала около двух часов и состояла из двух совершенно разных частей.

Первый час проходил с человеком — специально обученным консультантом. Он обсуждал со студентом тревогу, объяснял принцип экспозиции и помогал выбрать конкретное учебное задание, вызывающее умеренный уровень дискомфорта.

И только после этого начиналась работа с ИИ.

Что происходило во время часа с GPT-4o

Чат-бот не предлагал поговорить о жизни и не пытался убедить человека, что «всё будет хорошо».

У него был заранее заданный протокол.

Студент приступал к выбранной тревожащей задаче — например, к написанию сложной части учебной работы. Работа разбивалась на четыре десятиминутных отрезка.

После каждого отрезка GPT-4o спрашивал об уровне тревоги по шкале SUDS от 0 до 100, помогал сформулировать текущие опасения и фиксировал ожидания участника.

Например: «Я застряну и ничего не смогу написать».

Затем человек снова возвращался к задаче.

В конце система предлагала сравнить первоначальный прогноз с тем, что действительно произошло.

Это принципиальное отличие от обычного «эмпатичного чат-бота». ИИ использовался как инструмент, поддерживающий выполнение конкретной психологической процедуры.

Почему избегание способно поддерживать тревогу

Здесь находится главный механизм исследования.

Когда какая-то задача вызывает тревогу, естественная реакция — отложить её.

Не открывать документ.
Не начинать подготовку.
Ещё немного почитать.
Проверить телефон.
Перенести неприятное дело на вечер.

На несколько минут становится легче.

И именно поэтому избегание так хорошо закрепляется.

Мозг получает простой урок: «Я избежал неприятной ситуации — тревога уменьшилась». Но одновременно он лишается возможности получить другую информацию: возможно, ситуация была переносимой, тревога могла измениться сама, а ожидаемая катастрофа вообще не произошла.

Экспозиция разрывает этот цикл.

Человек остаётся в контакте с вызывающей тревогу задачей достаточно долго, чтобы получить новый опыт: «Я тревожусь, но могу продолжать действовать».

Поэтому связь между тревогой и прокрастинацией в этой работе не случайна. Авторы рассматривали откладывание учебных дел как один из вариантов избегания.

Два испытания вместо одного

Авторы провели два отдельных рандомизированных исследования.

Всего в анализ вошли 425 участников.

Первое исследование включало 90 студентов из 77 университетов 23 провинций Китая. Гибридную программу сравнивали с листом ожидания.

Но такой контроль имеет очевидное ограничение: люди, получающие полноценное вмешательство, получают гораздо больше внимания и активности.

Поэтому второе исследование было значительно важнее.

В нём участвовали 335 студентов из 224 университетов 28 провинций. На этот раз контрольная группа тоже получила двухчасовую активную программу: психообразовательные материалы и самостоятельную экспозиционную практику.

Таким образом, исследователи спрашивали уже не просто: «Лучше ли вмешательство, чем ничего?»

Вопрос был сложнее: даёт ли гибридная система «человек + GenAI» дополнительный эффект по сравнению с самостоятельной структурированной работой?

Результат оказался небольшим, но довольно последовательным

Да.

Через две недели в основном втором исследовании учебная тревога снизилась сильнее в гибридной группе, чем в активной контрольной группе. Размер межгруппового эффекта составил d = 0,35.

Для прокрастинации — d = 0,33.

Сразу после сессии различие по ситуативной тревоге составило d = 0,25.

Это не огромные эффекты. В сравнении с активным контролем их правильнее считать небольшими.

Но важно другое: контрольная группа тоже выполняла экспозиционное упражнение и тоже заметно улучшилась. Поэтому GenAI-программа сравнивалась не с бездействием, а с вполне содержательным вмешательством.

В первом, меньшем исследовании с листом ожидания различия ожидаемо оказались больше: примерно d = 0,43–0,58 по основным исходам.

Самый интересный результат — то, чего ИИ не изменил

Можно было бы остановиться здесь и написать: «ИИ уменьшил тревогу».

Но это было бы неточно.

Исследователи измеряли не только учебную тревогу. Они также оценивали генерализованную тревогу, депрессивные симптомы и положительные и отрицательные эмоции.

Во втором исследовании по всем этим вторичным показателям статистически значимого преимущества гибридной программы перед активным контролем не обнаружили.

И это меняет интерпретацию всей работы.

Программа не сделала участников психологически «здоровее вообще». Она преимущественно повлияла на то, на что была специально направлена: тревогу вокруг учебных задач, избегание этих задач и непосредственную тревогу во время вмешательства.

Именно такой результат выглядит гораздо правдоподобнее обещания универсального «ИИ-психолога».

Вот что здесь действительно неожиданно

Ценность генеративного ИИ могла заключаться не столько в том, что он хорошо разговаривал, сколько в том, что он помогал человеку последовательно выполнять терапевтическую процедуру.

GPT-4o спрашивал об уровне тревоги, возвращал участника к задаче, помогал сформулировать опасения и затем сопоставить прогноз с реальностью.

То есть важным мог быть не сам разговор с машиной, а структура поведения, которую этот разговор поддерживал.

Важным мог быть не сам разговор с машиной, а структура поведения, которую этот разговор поддерживал.

Более того, во время экспозиции субъективный уровень дистресса заметно снижался.

В первом исследовании средняя оценка SUDS уменьшилась от пикового значения 51,72 до 31,13 к окончанию практики. Во втором — с 51,00 до 29,84.

Однако авторы осторожны с объяснением механизма. Результаты анализа предполагаемых посредников эффекта различались между двумя исследованиями.

В первом более убедительным кандидатом оказалась самоэффективность — уверенность человека в способности справляться с учебными задачами.

Во втором более заметную роль сыграла толерантность к дистрессу — способность продолжать действовать, несмотря на неприятные переживания.

Поэтому говорить, что исследование уже установило единый механизм действия, нельзя.

А был ли ИИ безопасен?

Это один из наиболее важных вопросов работы.

Участники в целом хорошо приняли систему: в первом исследовании все сообщили о среднем или высоком уровне удовлетворённости, во втором таких было 96,1%.

Серьёзных нежелательных реакций исследователи не зарегистрировали.

Но здесь есть деталь, которую особенно важно не потерять.

Чат-бот ошибался.

Исследователи обнаружили несколько случаев, когда система самостоятельно записывала неверное значение SUDS — то есть фактически приписывала человеку уровень тревоги, который тот не сообщал.

В этих испытаниях ошибки были обнаружены и исправлены и не повлияли на результаты вмешательства.

Однако в реальной терапии подобная ошибка потенциально важна. Если система неправильно оценивает степень дистресса человека, она теоретически может неверно определить темп или интенсивность дальнейшей экспозиции.

Поэтому сами авторы подчёркивают: полученные данные поддерживают безопасность именно гибридной модели с человеческим наблюдением, а не полностью автономного ИИ-терапевта.

Человек никуда не исчез

Это ещё одна причина осторожно относиться к громкому выводу «GPT-4o провёл терапию».

Не провёл — по крайней мере, не самостоятельно.

Первую половину вмешательства выполнял обученный человек. Он собирал информацию, объяснял принципы терапии и вместе с участником выбирал подходящую экспозиционную задачу.

Во время работы с чат-ботом взаимодействие контролировал исследователь. Существовали процедуры выявления кризисных сообщений, остановки сессии и передачи ситуации человеку.

Сам GPT-4o тоже не работал как обычный свободный ChatGPT. Его поведение было ограничено подробными сценариями и заранее заданным рабочим процессом.

Получается интересное разделение труда.

Человек занимался выбором задачи, подготовкой и безопасностью. Машина брала на себя повторяющуюся структурированную часть экспозиционной практики.

Именно такую модель — а не замену специалиста чат-ботом — фактически проверяли исследователи.

Почему одна сессия вообще могла что-то изменить

Экспозиция отличается от многих представлений о психотерапии тем, что терапевтическое действие может происходить непосредственно во время столкновения с избегаемой ситуацией.

Человеку необязательно сначала полностью избавиться от тревоги, чтобы начать действовать.

Он может получить новый опыт прямо внутри тревоги.

В данном случае этот опыт был очень конкретным: студент начинал неприятную учебную задачу, оставался с ней четыре последовательных десятиминутных периода и проверял, действительно ли происходило то, чего он опасался.

Через две недели преимущества сохранялись для учебной тревоги и прокрастинации.

Но это пока максимальная продолжительность наблюдения.

Мы не знаем, сохранялся ли эффект через месяц, полгода или год.

Это не исследование тревожных расстройств вообще

У работы есть ещё несколько важных границ.

Участниками были в основном молодые студенты китайских университетов. В первом исследовании средний возраст составлял около 22 лет, во втором — также около 22 лет.

Людей с высоким суицидальным риском и тяжёлыми депрессивными симптомами исключали.

Поэтому результаты нельзя автоматически переносить на пациентов с паническим расстройством, обсессивно-компульсивным расстройством, тяжёлой депрессией или другими сложными психическими состояниями.

Не было и группы, в которой такое же вмешательство полностью проводил профессиональный терапевт. Следовательно, исследование не отвечает на вопрос, насколько GPT-4o эффективнее, хуже или сопоставим с человеком при проведении экспозиции.

Наконец, безопасность оценивалась не так полно, как потребовалось бы для клинического применения. Авторы прямо признают, что систематического экспертного аудита всего терапевтического содержания ответов чат-бота не проводилось.

Есть и потенциальный конфликт интересов: часть авторов указала заявку на патент, охватывающий элементы использованного в исследовании GenAI-компонента.

Будущее может быть не за «ИИ-психологом»

Это исследование интересно именно потому, что предлагает менее эффектное, но более реалистичное представление о роли генеративного ИИ в психическом здоровье.

Возможно, главный вопрос звучит не так:

«Может ли ChatGPT заменить психолога?»

А так:

«Какие конкретные части доказанного психологического вмешательства можно безопасно передать ИИ, оставив человеку то, где необходимы клиническое суждение, контроль и ответственность?»

В этой модели ИИ не обязан понимать человека так, как понимает его терапевт.

Ему достаточно надёжно выполнять ограниченную функцию внутри хорошо разработанной процедуры.

И если будущие исследования подтвердят эффективность и безопасность такого подхода в других группах и при более длительном наблюдении, именно это может оказаться одним из наиболее практичных способов применения генеративного ИИ в психическом здоровье.

Синтез от АПТЕКИУМ: Самый интересный результат этой работы не в том, что ИИ «умеет лечить тревогу». Он показывает более узкую и потенциально более ценную возможность: GenAI может помогать человеку выполнять конкретную доказательную психологическую процедуру — и эффект при этом остаётся преимущественно там, куда эта процедура была направлена.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.