ИИ-транскрипция в медицине: экономия времени оказалась гораздо сложнее, чем обещал рынок

Главная проблема ИИ-писаря начинается не тогда, когда он пишет медленно, а тогда, когда его текст приходится проверять дважды

История с медицинскими ИИ-писарями показывает важный разрыв между технологической метрикой и реальной экономикой врачебного времени. В рандомизированном исследовании один из двух протестированных ИИ-инструментов действительно сократил время работы врача с медицинской записью примерно на 9,5%, тогда как второй не дал статистически значимого выигрыша относительно обычной работы. При этом клиническая практика обнаруживает другую цену автоматизации: длинные записи, повторы, противоречия и ошибки заставляют врача проверять результат, а следующего специалиста — заново проверять уже проверенное. Поэтому главный вопрос для рынка медицинского ИИ меняется: не «умеет ли система автоматически написать запись?», а «может ли следующий врач безопасно доверять этой записи?».

ИИ-писари уже нельзя оценивать только по скорости создания медицинской документации. Лучшие данные показывают неоднозначную картину: в рандомизированном исследовании 238 врачей Nabla сократила время непосредственной работы с записью на 9,5% относительно контрольной группы, тогда как Microsoft DAX Copilot статистически значимого сокращения не показал. Одновременно использование ИИ-писарей сопровождалось небольшим снижением рабочей нагрузки и эмоционального истощения. Но исследования качества обнаруживают пропуски, добавление отсутствовавшей информации и другие ошибки, а врачи сообщают о необходимости внимательно перечитывать автоматически созданные тексты. Это означает, что технология может переносить работу, а не полностью устранять её: меньше времени на написание, больше — на верификацию. Для здравоохранения, фармацевтических компаний и разработчиков медицинского ИИ ключевой метрикой становится уже не скорость генерации текста, а стоимость получения короткой, клинически точной и достаточно надёжной записи.

ИИ-транскрипция в медицине: врач проверяет длинную автоматически созданную запись после консультации пациента
ИИ может сократить время на создание записи, но длинный текст, ошибки и повторная проверка превращают экономию в новую рабочую нагрузку.

Экономия есть — но она значительно меньше, чем позволяет представить сама идея автоматизации

Самое сильное возражение против тезиса «ИИ не экономит врачам время» заключается в том, что экспериментальные данные всё-таки обнаруживают экономию. Поэтому полностью списывать технологию со счетов было бы неправильно.

В рандомизированном исследовании участвовали 238 амбулаторных врачей 14 специальностей. Их распределили между Microsoft DAX Copilot, Nabla и контрольной группой.

Для Nabla время непосредственной работы с медицинской записью снизилось на 9,5% относительно контрольной группы. В абсолютных величинах среднее время сократилось с 4 минут 30 секунд примерно до 3 минут 49 секунд.

У DAX оно снизилось с 4 минут 29 секунд до 4 минут 6 секунд, однако разница относительно контрольной группы оказалась статистически незначимой.

Это важный результат: «ИИ-писарь» нельзя рассматривать как единую технологическую категорию с одинаковой эффективностью. Даже два ведущих решения в одном и том же рандомизированном исследовании дали разные результаты.

Есть и второй эффект. Пользователи обоих ИИ-писарей сообщали о снижении рабочей нагрузки и эмоционального истощения. То есть ценность технологии может существовать даже там, где экономия минут относительно невелика.

Но здесь начинается более интересная часть анализа.

41 секунда экономии может ничего не сказать о стоимости всей медицинской записи

Метрика time-in-note измеряет время, которое врач непосредственно проводит внутри записи электронной медицинской системы. Она удобна для исследования, но не эквивалентна полной стоимости документации для системы здравоохранения.

Врач может сэкономить время на создании первоначального текста, но затем потратить его на чтение, исправление и проверку.

Более того, последствия плохой записи могут возникнуть уже у другого врача.

Именно эту проблему описывает британский врач общей практики Мэри Гиббс. Работая с пациентами, которые предварительно прошли телефонный триаж, она сравнивает записи, подготовленные коллегами самостоятельно, с документацией, созданной при помощи ИИ.

По её наблюдениям, ИИ-записи оказываются длинными, содержат повторения и иногда внутренние противоречия. Ещё существеннее то, что повторно собранный анамнез пациента может заметно отличаться от информации в автоматически созданной записи.

Это не контролируемое исследование, а профессиональное наблюдение одного врача. Его нельзя использовать как доказательство того, что все ИИ-писари ухудшают документацию.

Но оно указывает на системную проблему, которую стандартная метрика времени может не увидеть.

Если первый врач экономит минуту, а следующий тратит две дополнительные минуты на проверку истории болезни, локальная производительность выросла, а производительность всей цепочки оказания помощи — нет.

ИИ хорошо превращает разговор в текст. Врачу требуется не текст

В этом месте становится заметна фундаментальная ошибка первоначальной концепции ИИ-транскрипции.

Медицинская документация — не стенограмма консультации.

Пациент может рассказывать историю нелинейно, возвращаться к одним симптомам несколько раз, путать последовательность событий, добавлять детали после уточняющих вопросов и использовать бытовые названия препаратов или заболеваний.

Задача врача заключается не в сохранении максимального количества произнесённых слов.

Он должен выполнить интеллектуальное сжатие информации: отделить существенное от второстепенного, связать симптомы во времени, отметить отрицательные данные, важные для дифференциальной диагностики, зафиксировать назначения и оставить следующему специалисту такую запись, которую можно быстро понять.

Именно поэтому длинная ИИ-запись способна формально содержать больше информации и одновременно быть хуже для клинической работы.

Это знакомая проблема информационных систем: полнота данных и полезность данных — разные характеристики.

Для медицины различие особенно важно, потому что цена информационного шума измеряется не только потерянными минутами.

Ошибки встречаются не только в рассказах недовольных врачей

Исследования качества автоматически создаваемых записей подтверждают, что необходимость проверки нельзя считать исключительно субъективной реакцией медиков.

В одном проспективном исследовании были детально оценены 356 клинических записей, созданных системами ambient AI — ИИ, который слушает разговор врача с пациентом и автоматически формирует документацию.

Самой частой ошибкой стали непреднамеренные пропуски: они обнаруживались в 18% оценённых записей. Галлюцинации — появление информации, которой не было в исходной консультации, — были зарегистрированы в 11,5%, непреднамеренное добавление информации — в 9,3%.

Большинство ошибок были лёгкими или умеренными.

Это принципиальная оговорка: сами результаты исследования не позволяют представить ИИ-документацию как массово опасную. Напротив, 94,7% оценённых записей не содержали значимых ошибок.

Но в 5,3% записей присутствовали ошибки, которым исследователи присвоили уровень потенциально серьёзного или непосредственного риска.

Поэтому даже сравнительно высокая средняя точность не отменяет необходимость контроля.

Для системы здравоохранения возникает неприятная асимметрия: чтобы воспользоваться преимуществами 94,7% удачных записей, врач всё равно должен искать ошибки в оставшихся.

Автоматизация создаёт новый вид работы — контроль автоматизации

Здесь находится главный экономический парадокс медицинского ИИ.

До внедрения системы врач создаёт документ.

После внедрения системы документ создаёт ИИ, а врач становится его редактором и контролёром.

На первый взгляд второй процесс должен быть быстрее. Но это зависит от трёх параметров:

  • насколько качественно ИИ отбирает клинически значимую информацию;
  • насколько короткой и структурированной получается запись;
  • насколько врач доверяет системе.

Последний фактор особенно важен.

Если технология ошибается крайне редко и предсказуемо, врач постепенно может проверять её результат быстрее.

Если ошибки редки, но потенциально существенны и непредсказуемы, поверхностная проверка становится опасной. Тогда врачу приходится читать практически весь текст.

Именно поэтому точность 95%, 98% или даже 99% сама по себе ещё ничего не говорит об экономической эффективности медицинского ИИ.

Нужно знать, где находятся оставшиеся проценты ошибок и сколько человеческого внимания требуется, чтобы их обнаружить.

Самая опасная потеря может оказаться не временной

Есть и менее очевидный риск.

Способность врача превратить сложную историю пациента в короткое клиническое изложение является частью медицинского мышления.

Чтобы написать хорошую запись, необходимо решить, что существенно, что связано между собой и что должен знать следующий специалист.

Если эту работу постоянно передавать алгоритму, существует вероятность постепенного ослабления навыка клинического синтеза.

Пока убедительных данных, позволяющих утверждать, что ИИ-писари действительно приводят к такому эффекту, нет. Поэтому это следует рассматривать как гипотезу, а не установленный вред.

Но для медицинского образования вопрос принципиален.

Калькулятор избавляет от арифметики. ИИ-писарь потенциально способен избавлять от части процесса структурирования клинической истории. Эти две формы автоматизации имеют совершенно разные последствия для профессиональной компетенции.

Для рынка медицинского ИИ начинается переход от демонстрации возможностей к доказательству экономики

Первая волна внедрения ambient AI продавалась через очень понятное обещание: врач меньше печатает, больше смотрит на пациента и раньше заканчивает рабочий день.

Теперь планка доказательств повышается.

Покупателю — клинике, сети медицинских центров или государственной системе — недостаточно показать, сколько записей автоматически создала система.

Необходимо измерять весь процесс:

  • время врача до и после консультации;
  • объём последующего редактирования;
  • частоту клинически значимых ошибок;
  • длину документа;
  • количество исправлений;
  • время, которое тратят на эту запись другие специалисты;
  • влияние на пропускную способность кабинета;
  • влияние на безопасность;
  • удовлетворённость врача и пациента.

И здесь может возникнуть существенное расслоение рынка.

Система, которая пишет красивый длинный текст, не обязательно будет коммерчески ценнее системы, которая создаёт гораздо более короткую, но клинически точную запись.

В медицинском ИИ способность правильно удалить лишнее может оказаться не менее важной, чем способность генерировать текст.

Для фармы проблема неожиданно близка

На первый взгляд речь идёт о медицинской IT-инфраструктуре, а не о фармацевтическом рынке. Но автоматическое создание медицинской документации постепенно становится частью информационной среды, внутри которой назначаются препараты.

Ошибка в названии лекарства, дозировке, продолжительности терапии или причине назначения уже непосредственно касается лекарственной безопасности.

В Великобритании Healthwatch England сообщила о случаях, когда пациенты обнаруживали ошибки ИИ-писарей, пропущенные медицинскими специалистами. В одном случае система перепутала назначенный препарат с другим лекарством с похожим названием. В другом автоматически сформированное письмо не включило указание о необходимости получить повторный рецепт.

Ещё показательнее ошибка, при которой результат исследования с отсутствием демиелинизации был записан как наличие демиелинизации. Пациент фактически получил противоположный смысл медицинского заключения.

Такие эпизоды пока не позволяют оценить популяционную частоту ошибок. Но они показывают механизм риска.

По мере проникновения ИИ в электронные медицинские записи фармаконадзор, сверка лекарственной терапии (medication reconciliation) и качество структурированных данных всё сильнее будут зависеть от того, насколько надёжно машина преобразует человеческую речь в медицинский факт.

Российскому рынку важнее не повторить фазу технологического восторга

Для России и других русскоязычных систем здравоохранения проблема может иметь дополнительный слой.

Качество распознавания зависит от языка, акцента, медицинской терминологии, торговых наименований препаратов, сокращений и особенностей реальной речи врача и пациента.

Поэтому результаты англоязычных систем нельзя автоматически переносить на русскоязычную клиническую практику.

Перед масштабным внедрением потребуется проверять не абстрактную точность распознавания речи, а работу на реальных клинических сценариях: полипрагмазии, пожилых пациентах, сложном анамнезе, телефонных консультациях, редких заболеваниях и созвучных названиях препаратов.

Особенно важен независимый аудит именно клинически значимых ошибок.

Средняя точность транскрипции здесь гораздо менее информативна, чем вероятность одного неправильного препарата или отрицания, потерянного перед диагнозом.

Победителем станет не тот ИИ, который пишет быстрее, а тот, чей текст быстрее читает следующий врач

Это меняет критерии закупки медицинских ИИ-систем.

Клиникам имеет смысл требовать от поставщиков не только демонстрацию скорости генерации документа и красивые показатели удовлетворённости пользователей, но и данные о последующем редактировании, частоте существенных ошибок и времени чтения записей другими специалистами.

Для разработчиков появляется другой продуктовый ориентир: сокращение документа может стать конкурентным преимуществом.

Для фармацевтических компаний особенно важными становятся точность лекарственных названий, дозировок и показаний, поскольку ошибки в этих полях способны искажать медицинские записи, реальные данные о применении препаратов и потенциально сигналы фармаконадзора.

Для руководителей медицинских организаций главный KPI также стоит изменить. Экономию следует считать не на этапе «врач перестал печатать», а на уровне полного маршрута информации от консультации до следующего клинического решения.

Если после внедрения ИИ запись создаётся быстрее, но её начинают читать медленнее, часть ожидаемого ROI просто перемещается из одной строки затрат в другую.

Что будет дальше: рынок начнёт измерять доверие

Технология ИИ-писарей вряд ли исчезнет. Напротив, имеющиеся рандомизированные данные показывают, что она способна уменьшать часть документационной нагрузки и снижать рабочее истощение врачей.

Но следующий этап развития будет заметно сложнее первоначального.

Системам придётся научиться не просто слышать консультацию, а понимать информационную иерархию медицинского разговора.

Вероятно, конкуренция постепенно сместится от качества транскрипции к качеству клинического сжатия: что нужно оставить, что можно убрать, что требует подтверждения и где система должна признать собственную неуверенность.

Именно здесь проходит граница между диктофоном с большой языковой моделью и действительно медицинским инструментом.

Синтез от АПТЕКИУМ: ИИ-писарь может сэкономить врачу секунды на создании записи и одновременно добавить минуты недоверия всей последующей цепочке лечения. Поэтому настоящая единица эффективности медицинского ИИ — не скорость генерации текста, а время от разговора с пациентом до клинической информации, которой следующий врач способен безопасно доверять.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.