Медицинский ИИ получил допуск в клиники быстрее, чем доказательства его пользы

Медицинский ИИ получил допуск в клиники быстрее, чем доказательства пользы для пациентов

Американский регулятор уже разрешил вывод на рынок более 1300 медицинских устройств с искусственным интеллектом, однако регуляторное разрешение не означает, что технология доказала способность улучшать здоровье пациентов. Анализ 691 устройства, опубликованный в JAMA Health Forum, обнаружил данные о пациент-значимых исходах лишь для трех из них. Проблема шире отдельных алгоритмов: традиционная система регулирования медицинских устройств оценивает прежде всего безопасность и работоспособность технологии в рамках заявленного назначения, тогда как клиницисту и пациенту нужен ответ на другой вопрос — улучшает ли ее применение диагностику, лечение или исход заболевания в реальной практике.

Врачи обсуждают с пациенткой результаты медицинской диагностики с использованием ИИ и сопоставляют их с клиническими данными
Регуляторный допуск алгоритма еще не означает, что его использование улучшает здоровье пациента.

Более 1300 разрешений FDA — но это не 1300 доказательств клинической пользы

Искусственный интеллект уже перестал быть экспериментальной технологией на периферии медицины. По данным FDA, к концу 2025 года американский регулятор разрешил вывод на рынок более 1300 медицинских устройств с ИИ. В актуальном перечне представлены системы анализа медицинских изображений, электрокардиограмм и других сигналов, диагностические и вспомогательные алгоритмы, программные продукты для планирования лечения и другие технологии.

Но количество регуляторных разрешений легко принять за показатель клинической зрелости направления. Это две разные вещи.

Особенно наглядно разрыв показало исследование Джона Лина и коллег, опубликованное в JAMA Health Forum. Авторы проанализировали 691 устройство с ИИ и машинным обучением, получившее разрешение FDA до конца рассматриваемого периода 1995–2023 годов. В 668 случаях, или 96,7%, использовалась процедура 510(k).

При этом только для шести устройств в доступной документации сообщались данные рандомизированных клинических исследований, а информация о результатах лечения или других исходах непосредственно для пациентов присутствовала лишь для трех — менее чем 1% изученной выборки.

Здесь важно уточнить цифры. Более 1300 устройств — это более поздний размер всего быстро растущего перечня FDA. Исследование JAMA Health Forum анализировало не все нынешние 1300 с лишним разрешений, а 691 устройство, допущенное к тому моменту, который охватывал его набор данных. Поэтому корректный вывод звучит не как «из 1300 устройств проверены три», а как «в исследованной выборке из 691 устройства только три сообщали данные о пациент-значимых исходах».

Это уточнение не ослабляет проблему. Оно делает ее точнее.

FDA часто отвечает на другой вопрос, чем врач и пациент

Причина такого разрыва становится понятнее, если разобраться, как регулируются медицинские устройства в США.

Лекарственный препарат и программный медицинский алгоритм проходят принципиально разные траектории оценки. Для нового лекарства обычно требуется клиническая программа, которая должна показать приемлемое соотношение пользы и риска для определенной группы пациентов. Для многих медицинских устройств действует другой подход.

Главный маршрут для ИИ-устройств — процедура 510(k). Она позволяет вывести устройство на рынок, если производитель продемонстрирует его «существенную эквивалентность» уже законно обращающемуся устройству-предшественнику. Сравниваются назначение и технологические характеристики, а объем необходимых клинических данных зависит от конкретного устройства и возникающих вопросов безопасности и эффективности.

Поэтому 510(k) не следует описывать как процедуру, при которой FDA вообще не оценивает безопасность или эффективность. Сам регулятор подчеркивает, что устройства из его перечня прошли применимые дорыночные требования, включая оценку адекватности представленных исследований для заявленного назначения.

Но здесь возникает принципиальная граница.

Алгоритм может достаточно хорошо обнаруживать патологию на изображении, измерять структуру органа или сортировать исследования по степени срочности — и соответствовать требованиям для выхода на рынок. Из этого еще не следует, что после его внедрения пациенты будут раньше получать лечение, реже сталкиваться с осложнениями или жить дольше.

Техническая или диагностическая точность — не то же самое, что клиническая польза.

Точность алгоритма и улучшение здоровья разделяет целая цепочка решений

Представим ИИ-систему, которая анализирует компьютерную томографию и лучше распознает определенную патологию. Разработчик может измерить чувствительность алгоритма — долю действительно больных пациентов, которых система правильно выявила, — и специфичность, то есть способность правильно распознавать людей без искомого состояния.

Это важные показатели. Но пациент получает пользу не от высокой чувствительности как таковой.

После сигнала алгоритма врач должен правильно интерпретировать результат. Решение должно изменить дальнейшую диагностику или лечение. Новое лечение должно начаться достаточно быстро. Оно должно быть эффективным. Дополнительные ложноположительные сигналы не должны приводить к такому количеству ненужных обследований и вмешательств, которое нивелирует потенциальную пользу.

Поэтому между фразами «алгоритм распознает заболевание» и «алгоритм улучшает здоровье пациентов» находится длинная причинно-следственная цепочка.

Именно эту цепочку рандомизированные и хорошо спроектированные проспективные исследования позволяют проверять значительно надежнее, чем ретроспективное тестирование алгоритма на уже собранных данных.

В анализе JAMA Health Forum сведения о проспективных исследованиях присутствовали для 53 устройств (7,7%). Только шесть устройств сообщали данные рандомизированных испытаний.

Даже описание доказательной базы оказалось неполным

Исследование выявило еще одну проблему: часто трудно оценить не только конечную клиническую пользу, но и качество самой проверки алгоритма.

Для 46,7% устройств в доступных регуляторных материалах не сообщался дизайн исследования. Демографические характеристики исследуемой популяции отсутствовали для 95,5%. Оценка возможного систематического смещения алгоритма была представлена для 60 устройств, или 8,7%.

Это особенно существенно для медицинского ИИ.

Обычный физический прибор после производства остается в значительной степени тем же прибором. Работа алгоритма зависит от данных, на которых он обучался и проверялся, а также от среды, в которую его затем помещают.

Система, хорошо работающая на снимках одного типа оборудования и одной популяции пациентов, не обязательно покажет ту же точность в другой больнице. Могут измениться аппаратура, протоколы получения изображений, распространенность заболеваний, возрастная структура пациентов и множество других характеристик.

Отсюда возникает проблема переносимости: насколько результат проверки в одной выборке можно распространять на другие группы пациентов и медицинские учреждения.

Отдельное исследование 903 разрешенных FDA устройств с ИИ, опубликованное в JAMA Network Open, также обнаружило существенные пробелы. Клинические исследования характеристик были указаны для 505 устройств, то есть примерно 56%. Проспективными были 41 из этих исследований, а рандомизированными — 12. Данные по полу и возрастным подгруппам также сообщались далеко не всегда.

Два анализа используют разные выборки и критерии, поэтому их цифры нельзя непосредственно складывать или сравнивать как результаты одного исследования. Но направление сигнала совпадает: объем клинической информации вокруг медицинского ИИ заметно отстает от скорости появления новых продуктов.

После разрешения возникает еще одна проблема: алгоритм попадает в изменчивый мир

Для ИИ дорыночная проверка имеет дополнительное ограничение. Среда его работы способна изменяться.

В машинном обучении существует понятие сдвига данных: характеристики поступающих в систему данных со временем начинают отличаться от тех, на которых алгоритм разрабатывали и проверяли. Меняется популяция пациентов, оборудование, протоколы диагностики или организация медицинской помощи — и качество модели может измениться вместе с ними.

Поэтому для медицинского ИИ особенно важен контроль после выхода на рынок.

В исследовании JAMA Health Forum у 36 из 691 устройства были зарегистрированы сообщения о нежелательных событиях, а 40 устройств отзывались с рынка в общей сложности 113 раз. Авторы отдельно предупреждают, что небольшое количество зарегистрированных событий нельзя интерпретировать как доказательство высокой безопасности: оно может отражать ограничения существующей системы наблюдения и отчетности.

Более свежий анализ 903 устройств в JAMA Network Open обнаружил 43 устройства, которые подвергались отзыву. У устройств, для которых отсутствовала информация о подтверждающих клинических исследованиях, оценка риска отзыва была выше, хотя статистическая неопределенность результата оставалась значительной.

Это не доказывает, что отсутствие опубликованного клинического исследования само по себе вызывает проблемы с устройством. Но показывает, почему прозрачность доказательной базы и последующее наблюдение нельзя считать второстепенными требованиями.

Регуляторы столкнулись с технологией, которая развивается быстрее привычной модели контроля

Проблема не сводится к недостаточной строгости FDA. Скорее медицинский ИИ обнаружил несоответствие между устройством традиционной регуляторной системы и новым типом технологии.

FDA уже движется в сторону регулирования всего жизненного цикла ИИ-устройств, включая управление изменениями алгоритмов после выхода на рынок. Исследователи предлагают идти дальше: стандартизировать описание клинических данных, улучшать контроль после внедрения и уделять больше внимания реальным результатам для пациентов.

Параллельно меняется сама методология исследований.

В Nature Medicine в 2026 году исследователи обсуждали модели клинических испытаний для ИИ-систем, которые постоянно контролируются и обновляются. Для таких технологий классическая схема «создали продукт — испытали — разрешили — используем неизменным» действительно становится все менее подходящей.

В результате формируется новая регуляторная задача: проверять не только исходную версию алгоритма, но и способность всей системы сохранять приемлемое качество после внедрения.

Для больниц следующий вопрос после «разрешено ли FDA?» становится важнее самого разрешения

Для пациента эти дискуссии могут казаться техническими, но их последствия вполне практические.

Разрешение регулятора остается важным фильтром. Оно означает, что устройство прошло предусмотренную для него процедуру оценки и может законно использоваться в рамках заявленного назначения. Но знак регуляторного допуска не отвечает автоматически на вопрос, улучшает ли конкретная система результаты лечения по сравнению с существующей практикой.

Для больниц и врачей это означает необходимость второго уровня оценки перед внедрением: на каких пациентах проверялся алгоритм, насколько эта популяция похожа на собственных пациентов медицинского учреждения, исследовалось ли его применение проспективно, меняет ли оно решения врача и существуют ли данные о влиянии на клинические исходы.

Для разработчиков ситуация также меняется. Пока рынок рос преимущественно вокруг способности получить регуляторное разрешение и продемонстрировать технические характеристики продукта. По мере насыщения рынка конкурентным преимуществом может становиться уже не сам факт наличия ИИ и даже не разрешение FDA, а доказательство измеримой пользы в реальной медицинской практике.

Для систем здравоохранения это особенно важно из-за стоимости внедрения. Алгоритм требует интеграции с медицинскими информационными системами, обучения персонала, контроля качества и иногда изменения рабочих процессов. Даже точный ИИ может оказаться экономически бессмысленным, если он не меняет решения врача или не улучшает результат лечения.

Именно поэтому следующий этап развития медицинского ИИ, вероятно, будет определяться не количеством новых алгоритмов, а качеством доказательств вокруг них.

Синтез от АПТЕКИУМ: История медицинского ИИ показывает фундаментальное различие между тремя этапами инновации: технология может работать, регулятор может разрешить ее применение, но только клиническое исследование и последующая реальная практика способны показать, становится ли от этого лучше пациенту. Медицинский ИИ уже чрезвычайно быстро прошел первые два этапа. Теперь отрасли предстоит гораздо более сложный третий — перейти от доказательства возможностей алгоритма к доказательству его реальной ценности для здоровья.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.