Медицинский ИИ: почему тысячи исследований не доходят до клинических испытаний
Медицинский ИИ производит тысячи публикаций, но до проверки на пациентах доходит лишь малая часть
Искусственный интеллект уже умеет находить опухоли на снимках, анализировать цифровую патологию, прогнозировать риски и помогать врачу принимать решения. Но бурный рост научных публикаций создает впечатление зрелости, которой клиническая доказательная база пока не подтверждает. Крупный анализ 4667 исследований медицинского ИИ обнаружил всего 113 рандомизированных контролируемых испытаний — 2,4%. Для больших языковых моделей разрыв еще заметнее: среди 4609 клинических публикаций лишь 19 представляли собой проспективные рандомизированные исследования.

Тысячи исследований создают картину зрелой технологии, которой пока нет
Аналитики Inventorus обратили внимание на фундаментальный разрыв между количеством работ по искусственному интеллекту в медицине и уровнем доказательств, полученных в реальной клинической практике. Однако приведенные ими цифры происходят не из одного исследования, а из нескольких крупных международных обзоров, рассматривающих разные сегменты медицинского ИИ.
Один из главных источников — опубликованный в апреле 2026 года в npj Digital Medicine анализ глобальных исследований медицинского искусственного интеллекта. Авторы начали с 218 систематических обзоров и извлекли из них 4667 первичных исследований. Затем работы распределили по стадиям развития — от разработки алгоритма и ретроспективной проверки до испытаний в реальной клинической среде.
Картина оказалась крайне неравномерной. 4114 работ, или 88,2%, относились к доклинической разработке и проверке без использования ИИ для ведения пациентов в реальном времени. Еще 440 представляли собой ранние клинические оценки. Только 113 исследований — 2,4% всей выборки — были рандомизированными контролируемыми испытаниями.
Важно правильно понимать эту цифру. Она не означает, что 97,6% медицинского ИИ «не работает». Она означает другое: для подавляющего большинства опубликованных систем пока нет наиболее надежного типа данных, позволяющего утверждать, что их использование действительно улучшает работу врача, медицинский процесс или значимые для пациента результаты.
Высокая точность алгоритма еще не означает пользу для пациента
Именно здесь проходит одна из важнейших границ современной цифровой медицины.
Алгоритм можно обучить на тысячах снимков, а затем показать, что на тестовом наборе данных он распознает определенную патологию с высокой чувствительностью и специфичностью. Для разработки технологии это существенный результат. Но клинический вопрос устроен сложнее: что произойдет, если такой алгоритм встроить в реальную работу больницы?
Врач может игнорировать его рекомендации. Система может выдавать слишком много предупреждений. Данные пациентов другого медицинского центра могут отличаться от обучающей выборки. Алгоритм способен хорошо распознавать изображение, но не менять решения врача. Наконец, улучшение диагностической точности не обязательно приводит к улучшению исходов лечения.
Поэтому поздняя клиническая проверка оценивает уже не только саму математическую модель, а систему «алгоритм — врач — пациент — медицинская организация».
Это хорошо видно по структуре найденных рандомизированных исследований. В 64,6% испытаний сравнивали работу специалиста с поддержкой ИИ и без нее. В 28,3% — помощь с использованием ИИ с обычной медицинской практикой. И только 7,1% непосредственно противопоставляли ИИ врачу.
Наиболее реалистичная модель медицинского искусственного интеллекта сегодня — не автономная замена специалиста, а технология, встроенная в работу человека.
Иными словами, наиболее реалистичная модель медицинского искусственного интеллекта сегодня — не автономная замена специалиста, а технология, встроенная в работу человека.
Даже 113 рандомизированных испытаний нельзя считать окончательным доказательством
На первый взгляд результаты существующих испытаний выглядят убедительно: в 82,3% из 113 рандомизированных исследований авторы сообщили о благоприятном результате по основной конечной точке. В 88 исследованиях было получено статистически значимое улучшение, еще в пяти показана не меньшая эффективность по сравнению с контрольным подходом.
Но именно здесь необходима осторожность.
67,3% рандомизированных исследований проводились только в одном медицинском центре. Медианный размер выборки составлял 278 участников. Это ограничивает возможность переносить результаты на другие больницы, страны, группы пациентов и медицинские процессы.
Еще один тревожный показатель касается качества описания исследований. 71,7% испытаний не указывали использование какого-либо стандарта отчетности. У значительной части работ исследователи также выявили методологические проблемы, связанные, в частности, с сокрытием распределения участников по группам и ослеплением.
Для медицинского ИИ это особенно сложная проблема. Если врачу на экране показывают рекомендацию алгоритма, скрыть сам факт использования технологии зачастую невозможно. Поэтому классические принципы лекарственных испытаний нельзя механически переносить на цифровые вмешательства — дизайн исследований приходится адаптировать к тому, как ИИ реально используется в клинике.
Есть и еще одно ограничение. Авторы глобального обзора предупреждают о возможном публикационном смещении: исследования с отрицательными или статистически незначимыми результатами могут публиковаться реже. Поэтому доля благоприятных результатов среди найденных испытаний способна переоценивать реальную эффективность медицинского ИИ.
Большие языковые модели увеличили публикационный разрыв еще сильнее
Отдельную картину дает анализ больших языковых моделей — технологий, лежащих в основе современных генеративных систем.
В марте 2026 года Nature Medicine опубликовал масштабный систематический обзор применения больших языковых моделей в клинической медицине. Авторы обнаружили 4609 рецензируемых исследований, опубликованных с января 2022 по сентябрь 2025 года. Это примерно 3,2 новой статьи каждый день.
Но количество снова оказалось плохим показателем клинической зрелости.
Из 4609 работ только 1048 использовали реальные данные пациентов. 1857 исследований основывались преимущественно на моделируемых клинических сценариях, еще 1704 — на задачах экзаменационного типа. Проспективными рандомизированными испытаниями оказались лишь 19 работ.
Это принципиальная разница. Ответить на медицинский экзаменационный вопрос, сформулировать диагноз по подготовленному описанию случая и безопасно помогать врачу в настоящей клинике — три совершенно разных уровня сложности.
В реальной медицине информация бывает неполной, противоречивой и распределенной между медицинской картой, результатами исследований и словами пациента. Ошибка имеет последствия. Кроме того, значение имеет не только правильность ответа модели, но и то, как человек интерпретирует рекомендацию и меняет ли она медицинское решение.
Поэтому впечатляющие результаты языковой модели на тестах нельзя автоматически интерпретировать как доказательство ее клинической эффективности.
Онкология стала главным полигоном для медицинского ИИ
В глобальном анализе 4667 исследований на новообразования пришлось 32,5% всех первичных работ — 1518 публикаций. Болезни опорно-двигательной системы занимали второе место с 14,1%, далее следовали заболевания нервной системы — 12,0% и органов зрения — 10,0%.
Такое распределение не случайно.
Онкология производит огромные массивы данных, хорошо подходящих для машинного анализа: компьютерную томографию, магнитно-резонансную томографию, цифровые изображения гистологических препаратов, геномные данные и структурированные клинические показатели. Радиология и цифровая патология особенно удобны для разработки ИИ, поскольку алгоритм получает стандартизированный цифровой объект, который можно сопоставить с экспертной оценкой.
Но лидерство по количеству публикаций не означает лидерства по клиническим доказательствам. Среди 113 рандомизированных испытаний на онкологию приходилось лишь 12, или 10,6%. Наибольшая доля рандомизированных исследований неожиданно относилась к заболеваниям пищеварительной системы — 43 работы, или 38,1%.
Этот разрыв показывает важную закономерность: области, где легче всего разработать и ретроспективно проверить алгоритм, не обязательно оказываются теми областями, где проще доказать его пользу в реальной клинической практике.
Главная проблема переместилась от алгоритма к медицинской системе
В раннюю эпоху медицинского ИИ главным вопросом была точность модели: насколько хорошо алгоритм распознает опухоль, прогнозирует осложнение или классифицирует изображение.
Теперь этого недостаточно.
Среди рандомизированных испытаний с неблагоприятными результатами авторы глобального обзора регулярно обнаруживали проблемы не только самого алгоритма. Возникали трудности интеграции технологии в рабочий процесс, взаимодействия человека с системой, выбора правильной конечной точки исследования и достаточного размера выборки.
Это меняет представление о том, что означает «эффективный медицинский ИИ».
Даже очень точная модель может оказаться практически бесполезной, если она выдает рекомендацию слишком поздно, увеличивает нагрузку врача, плохо встроена в медицинскую информационную систему или предлагает действие, которое специалист не может выполнить. И наоборот, относительно небольшое улучшение алгоритмической точности способно иметь значение, если технология экономит время, раньше обнаруживает опасное состояние или предотвращает ненужные вмешательства.
Следующий этап развития медицинского ИИ поэтому будет определяться не столько соревнованием моделей по лабораторным показателям, сколько способностью доказать пользу внутри реальной системы здравоохранения.
- Крах лабораторных иллюзий: почему точность медицинского ИИ падает втрое при столкновении с пациентом
- Ошибки в моделях выживаемости меняют взгляд на цифровую онкологию
Контекст рынка и отрасли:
Клиникам придется требовать доказательства, которые невозможно получить на тестовой выборке
Для пациентов эти результаты означают прежде всего необходимость различать присутствие ИИ в медицине и доказанную пользу конкретной системы. Само обозначение «искусственный интеллект» ничего не говорит о том, прошла ли технология внешнюю проверку, исследовалась ли она проспективно и улучшает ли значимые клинические результаты.
Для врачей ключевым становится вопрос переносимости результатов. Алгоритм, успешно испытанный в одном академическом медицинском центре, может вести себя иначе в региональной больнице, на другом оборудовании или в популяции пациентов с иной структурой заболеваний.
Для разработчиков и медицинских организаций планка также повышается. Все большее значение будут иметь многоцентровые проспективные исследования, проверка на независимых данных, оценка влияния на рабочие процессы, безопасность, нагрузку персонала, стоимость медицинской помощи и результаты, действительно важные пациенту.
Особая проблема возникает с быстро меняющимися системами. В отличие от таблетки с фиксированным составом, программная модель может обновляться. Большие языковые модели способны существенно меняться между версиями. Поэтому успешное испытание одной версии системы не гарантирует автоматически сохранения тех же свойств после обновления.
Это делает необходимым не только испытание перед внедрением, но и наблюдение после него: контроль изменения характеристик модели, ошибок, безопасности и результатов в разных группах пациентов.
Для профессионального сообщества:
Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.
Источники и материалы
- GxP News — «Аналитики: лишь 2,4% работ по ИИ в медицине прошли клиническую проверку»
- npj Digital Medicine — A quantitative analysis of global AI medical studies: gaps in randomized controlled trials
- PubMed — A quantitative analysis of global AI medical studies: gaps in randomized controlled trials
- Nature Medicine — LLM-assisted systematic review of large language models in clinical medicine
- npj Digital Medicine — Clinical outcomes and reporting quality of large language model interventions in practice: a systematic evidence map


