ИИ не успокаивал тревогу — он помогал делать то, чего человек избегал
Одна гибридная сессия с GenAI снизила учебную тревогу и прокрастинацию, но не улучшила «психическое здоровье вообще»
Исследователи проверили необычный сценарий применения генеративного ИИ: не свободную беседу «с цифровым психологом», а строго структурированную экспозиционную практику. В двух рандомизированных исследованиях с 425 студентами гибридная программа «человек + GPT-4o» сильнее контрольных условий уменьшала именно те проблемы, на которые была направлена: учебную тревогу и прокрастинацию. Но широкого преимущества по генерализованной тревоге и депрессивным симптомам не обнаружили — и именно эта специфичность результата, возможно, является главным выводом работы.

ИИ здесь был не психологом, а частью процедуры
Когда обсуждают генеративный ИИ и психическое здоровье, разговор часто сводится к крайностям. Либо чат-бот скоро заменит психотерапевта, либо языковая модель в принципе не способна принести терапевтическую пользу.
Исследование команды из Tsinghua University и других университетов предлагает гораздо более интересный третий вариант: ИИ может выполнять ограниченную и заранее определённую часть психологического вмешательства.
Авторы выбрали экспозиционную терапию — один из наиболее хорошо изученных подходов к лечению тревожных расстройств. Её центральная идея на первый взгляд парадоксальна: человеку предлагают не избегать вызывающей тревогу ситуации, а безопасно и контролируемо сталкиваться с ней.
В исследовании речь шла не о тяжёлых клинических тревожных расстройствах, а об учебной тревоге — тревоге, связанной с учёбой. Участниками были студенты китайских университетов с повышенным уровнем такой тревоги.
Программа занимала около двух часов и состояла из двух совершенно разных частей.
Первый час проходил с человеком — специально обученным консультантом. Он обсуждал со студентом тревогу, объяснял принцип экспозиции и помогал выбрать конкретное учебное задание, вызывающее умеренный уровень дискомфорта.
И только после этого начиналась работа с ИИ.
Что происходило во время часа с GPT-4o
Чат-бот не предлагал поговорить о жизни и не пытался убедить человека, что «всё будет хорошо».
У него был заранее заданный протокол.
Студент приступал к выбранной тревожащей задаче — например, к написанию сложной части учебной работы. Работа разбивалась на четыре десятиминутных отрезка.
После каждого отрезка GPT-4o спрашивал об уровне тревоги по шкале SUDS от 0 до 100, помогал сформулировать текущие опасения и фиксировал ожидания участника.
Например: «Я застряну и ничего не смогу написать».
Затем человек снова возвращался к задаче.
В конце система предлагала сравнить первоначальный прогноз с тем, что действительно произошло.
Это принципиальное отличие от обычного «эмпатичного чат-бота». ИИ использовался как инструмент, поддерживающий выполнение конкретной психологической процедуры.
Почему избегание способно поддерживать тревогу
Здесь находится главный механизм исследования.
Когда какая-то задача вызывает тревогу, естественная реакция — отложить её.
Не открывать документ.
Не начинать подготовку.
Ещё немного почитать.
Проверить телефон.
Перенести неприятное дело на вечер.
На несколько минут становится легче.
И именно поэтому избегание так хорошо закрепляется.
Мозг получает простой урок: «Я избежал неприятной ситуации — тревога уменьшилась». Но одновременно он лишается возможности получить другую информацию: возможно, ситуация была переносимой, тревога могла измениться сама, а ожидаемая катастрофа вообще не произошла.
Экспозиция разрывает этот цикл.
Человек остаётся в контакте с вызывающей тревогу задачей достаточно долго, чтобы получить новый опыт: «Я тревожусь, но могу продолжать действовать».
Поэтому связь между тревогой и прокрастинацией в этой работе не случайна. Авторы рассматривали откладывание учебных дел как один из вариантов избегания.
Два испытания вместо одного
Авторы провели два отдельных рандомизированных исследования.
Всего в анализ вошли 425 участников.
Первое исследование включало 90 студентов из 77 университетов 23 провинций Китая. Гибридную программу сравнивали с листом ожидания.
Но такой контроль имеет очевидное ограничение: люди, получающие полноценное вмешательство, получают гораздо больше внимания и активности.
Поэтому второе исследование было значительно важнее.
В нём участвовали 335 студентов из 224 университетов 28 провинций. На этот раз контрольная группа тоже получила двухчасовую активную программу: психообразовательные материалы и самостоятельную экспозиционную практику.
Таким образом, исследователи спрашивали уже не просто: «Лучше ли вмешательство, чем ничего?»
Вопрос был сложнее: даёт ли гибридная система «человек + GenAI» дополнительный эффект по сравнению с самостоятельной структурированной работой?
Результат оказался небольшим, но довольно последовательным
Да.
Через две недели в основном втором исследовании учебная тревога снизилась сильнее в гибридной группе, чем в активной контрольной группе. Размер межгруппового эффекта составил d = 0,35.
Для прокрастинации — d = 0,33.
Сразу после сессии различие по ситуативной тревоге составило d = 0,25.
Это не огромные эффекты. В сравнении с активным контролем их правильнее считать небольшими.
Но важно другое: контрольная группа тоже выполняла экспозиционное упражнение и тоже заметно улучшилась. Поэтому GenAI-программа сравнивалась не с бездействием, а с вполне содержательным вмешательством.
В первом, меньшем исследовании с листом ожидания различия ожидаемо оказались больше: примерно d = 0,43–0,58 по основным исходам.
Самый интересный результат — то, чего ИИ не изменил
Можно было бы остановиться здесь и написать: «ИИ уменьшил тревогу».
Но это было бы неточно.
Исследователи измеряли не только учебную тревогу. Они также оценивали генерализованную тревогу, депрессивные симптомы и положительные и отрицательные эмоции.
Во втором исследовании по всем этим вторичным показателям статистически значимого преимущества гибридной программы перед активным контролем не обнаружили.
И это меняет интерпретацию всей работы.
Программа не сделала участников психологически «здоровее вообще». Она преимущественно повлияла на то, на что была специально направлена: тревогу вокруг учебных задач, избегание этих задач и непосредственную тревогу во время вмешательства.
Именно такой результат выглядит гораздо правдоподобнее обещания универсального «ИИ-психолога».
Вот что здесь действительно неожиданно
Ценность генеративного ИИ могла заключаться не столько в том, что он хорошо разговаривал, сколько в том, что он помогал человеку последовательно выполнять терапевтическую процедуру.
GPT-4o спрашивал об уровне тревоги, возвращал участника к задаче, помогал сформулировать опасения и затем сопоставить прогноз с реальностью.
То есть важным мог быть не сам разговор с машиной, а структура поведения, которую этот разговор поддерживал.
Важным мог быть не сам разговор с машиной, а структура поведения, которую этот разговор поддерживал.
Более того, во время экспозиции субъективный уровень дистресса заметно снижался.
В первом исследовании средняя оценка SUDS уменьшилась от пикового значения 51,72 до 31,13 к окончанию практики. Во втором — с 51,00 до 29,84.
Однако авторы осторожны с объяснением механизма. Результаты анализа предполагаемых посредников эффекта различались между двумя исследованиями.
В первом более убедительным кандидатом оказалась самоэффективность — уверенность человека в способности справляться с учебными задачами.
Во втором более заметную роль сыграла толерантность к дистрессу — способность продолжать действовать, несмотря на неприятные переживания.
Поэтому говорить, что исследование уже установило единый механизм действия, нельзя.
А был ли ИИ безопасен?
Это один из наиболее важных вопросов работы.
Участники в целом хорошо приняли систему: в первом исследовании все сообщили о среднем или высоком уровне удовлетворённости, во втором таких было 96,1%.
Серьёзных нежелательных реакций исследователи не зарегистрировали.
Но здесь есть деталь, которую особенно важно не потерять.
Чат-бот ошибался.
Исследователи обнаружили несколько случаев, когда система самостоятельно записывала неверное значение SUDS — то есть фактически приписывала человеку уровень тревоги, который тот не сообщал.
В этих испытаниях ошибки были обнаружены и исправлены и не повлияли на результаты вмешательства.
Однако в реальной терапии подобная ошибка потенциально важна. Если система неправильно оценивает степень дистресса человека, она теоретически может неверно определить темп или интенсивность дальнейшей экспозиции.
Поэтому сами авторы подчёркивают: полученные данные поддерживают безопасность именно гибридной модели с человеческим наблюдением, а не полностью автономного ИИ-терапевта.
Человек никуда не исчез
Это ещё одна причина осторожно относиться к громкому выводу «GPT-4o провёл терапию».
Не провёл — по крайней мере, не самостоятельно.
Первую половину вмешательства выполнял обученный человек. Он собирал информацию, объяснял принципы терапии и вместе с участником выбирал подходящую экспозиционную задачу.
Во время работы с чат-ботом взаимодействие контролировал исследователь. Существовали процедуры выявления кризисных сообщений, остановки сессии и передачи ситуации человеку.
Сам GPT-4o тоже не работал как обычный свободный ChatGPT. Его поведение было ограничено подробными сценариями и заранее заданным рабочим процессом.
Получается интересное разделение труда.
Человек занимался выбором задачи, подготовкой и безопасностью. Машина брала на себя повторяющуюся структурированную часть экспозиционной практики.
Именно такую модель — а не замену специалиста чат-ботом — фактически проверяли исследователи.
Почему одна сессия вообще могла что-то изменить
Экспозиция отличается от многих представлений о психотерапии тем, что терапевтическое действие может происходить непосредственно во время столкновения с избегаемой ситуацией.
Человеку необязательно сначала полностью избавиться от тревоги, чтобы начать действовать.
Он может получить новый опыт прямо внутри тревоги.
В данном случае этот опыт был очень конкретным: студент начинал неприятную учебную задачу, оставался с ней четыре последовательных десятиминутных периода и проверял, действительно ли происходило то, чего он опасался.
Через две недели преимущества сохранялись для учебной тревоги и прокрастинации.
Но это пока максимальная продолжительность наблюдения.
Мы не знаем, сохранялся ли эффект через месяц, полгода или год.
Это не исследование тревожных расстройств вообще
У работы есть ещё несколько важных границ.
Участниками были в основном молодые студенты китайских университетов. В первом исследовании средний возраст составлял около 22 лет, во втором — также около 22 лет.
Людей с высоким суицидальным риском и тяжёлыми депрессивными симптомами исключали.
Поэтому результаты нельзя автоматически переносить на пациентов с паническим расстройством, обсессивно-компульсивным расстройством, тяжёлой депрессией или другими сложными психическими состояниями.
Не было и группы, в которой такое же вмешательство полностью проводил профессиональный терапевт. Следовательно, исследование не отвечает на вопрос, насколько GPT-4o эффективнее, хуже или сопоставим с человеком при проведении экспозиции.
Наконец, безопасность оценивалась не так полно, как потребовалось бы для клинического применения. Авторы прямо признают, что систематического экспертного аудита всего терапевтического содержания ответов чат-бота не проводилось.
Есть и потенциальный конфликт интересов: часть авторов указала заявку на патент, охватывающий элементы использованного в исследовании GenAI-компонента.
- Почему поколение Z сначала спрашивает о здоровье искусственный интеллект
- Psychological Science форсирует внедрение КПТ нового поколения
Контекст рынка и отрасли:
Будущее может быть не за «ИИ-психологом»
Это исследование интересно именно потому, что предлагает менее эффектное, но более реалистичное представление о роли генеративного ИИ в психическом здоровье.
Возможно, главный вопрос звучит не так:
«Может ли ChatGPT заменить психолога?»
А так:
«Какие конкретные части доказанного психологического вмешательства можно безопасно передать ИИ, оставив человеку то, где необходимы клиническое суждение, контроль и ответственность?»
В этой модели ИИ не обязан понимать человека так, как понимает его терапевт.
Ему достаточно надёжно выполнять ограниченную функцию внутри хорошо разработанной процедуры.
И если будущие исследования подтвердят эффективность и безопасность такого подхода в других группах и при более длительном наблюдении, именно это может оказаться одним из наиболее практичных способов применения генеративного ИИ в психическом здоровье.
Для профессионального сообщества:
Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.
Источники и материалы
- Safety, efficacy and acceptability of human-GenAI single-session exposure-based intervention for academic anxiety: randomized controlled trials
- Randomized controlled trial of GenAI coach feedback efficacy, acceptability and mechanisms in anxiety worry logs
- Maximizing exposure therapy: An inhibitory learning approach
- Large language models could change the future of behavioral healthcare: a proposal for responsible development and evaluation


