Почему медицинский ИИ редко доходит до клинических испытаний
Медицинский ИИ дошёл до тысяч публикаций — но до проверки на пациентах добирается лишь малая часть
Искусственный интеллект уже применяется почти по всей цепочке медицинских исследований, однако количество публикаций сильно опережает накопление клинических доказательств. Анализ 4667 первичных исследований показал: 88,2% работ ограничились доклинической разработкой или проверкой на ранее собранных данных, 9,4% дошли до ранней оценки в реальной клинической среде и только 2,4% представляли собой рандомизированные контролируемые исследования. Это не означает, что «ИИ в медицине не работает». Проблема точнее и интереснее: мы научились быстро создавать и тестировать медицинские алгоритмы, но пока гораздо медленнее выясняем, улучшают ли они лечение реальных пациентов.

За цифрой 2,4% скрывается важное различие между алгоритмом и медицинским доказательством
Поводом для обсуждения стал анализ компании Inventorus, обратившей внимание на разрыв между масштабом исследований искусственного интеллекта и уровнем их клинической проверки. Но ключевые цифры — 88,2% и 2,4% — происходят из опубликованного в 2026 году исследования в npj Digital Medicine.
Авторы этой работы проанализировали 218 систематических обзоров и выделили из них 4667 первичных исследований медицинского ИИ. Работы распределили по степени близости к реальной клинической практике.
4114 исследований, или 88,2%, относились к доклинической разработке и проверке на уже существующих данных. Ещё 440 работ, или 9,4%, представляли собой раннюю оценку технологии в реальной клинической среде. И только 113 исследований — 2,4% — были рандомизированными контролируемыми испытаниями.
Поэтому утверждение, что лишь 2,4% исследований «прошли клиническую проверку», требует уточнения. Клиническая оценка проводилась чаще. 2,4% — это доля исследований, достигших более строгого уровня проверки: рандомизированного контролируемого исследования.
Разница принципиальна. Алгоритм может великолепно распознавать заболевание на архивных снимках и всё же не улучшить диагностику после внедрения в больнице. Он может правильно предсказывать риск осложнения, но не изменить решения врача. Наконец, технология может повысить точность одного этапа работы, одновременно увеличив число ненужных обследований, время работы персонала или стоимость медицинской помощи.
Именно поэтому медицина спрашивает не только «насколько точна модель?», но и «что происходит с пациентом, когда эту модель начинают использовать?».
Онкология производит больше всего исследований ИИ, но далеко не больше всего строгих испытаний
Особенно показателен пример онкологии. Из 4667 проанализированных работ 1518, или 32,5%, были посвящены новообразованиям — больше, чем любой другой группе заболеваний.
Причина понятна. Современная онкология создаёт огромные объёмы структурированных цифровых данных: компьютерную томографию и МРТ, цифровые изображения тканей, геномные последовательности, молекулярные характеристики опухоли, результаты лечения и электронные медицинские записи. Для машинного обучения это исключительно богатая среда.
Но лидерство по количеству публикаций не превратилось в лидерство по качеству клинических доказательств. Среди 113 рандомизированных исследований на онкологию приходилось только 12 — 10,6%. Наибольшая доля таких испытаний относилась к заболеваниям пищеварительной системы — 43 исследования, или 38,1%.
Это хорошо показывает основное узкое место медицинского ИИ. Получить набор данных, обучить алгоритм и продемонстрировать высокую точность на тестовой выборке значительно проще, чем встроить систему в реальный лечебный процесс и доказать, что она приносит пациенту измеримую пользу.
Даже 113 рандомизированных исследований ещё не означают 113 окончательных доказательств
Небольшое количество испытаний — только часть проблемы. Важна и их конструкция.
Из 113 рандомизированных исследований 76, или 67,3%, проводились только в одном медицинском центре. Это ограничивает возможность переносить результат на другие больницы, страны и группы пациентов.
Медицинский алгоритм особенно чувствителен к таким различиям. Модель может обучаться на снимках, полученных на определённом оборудовании, на пациентах конкретного возраста и происхождения или на данных, оформленных по правилам одной клиники. При переходе в другую больницу меняются аппаратура, протоколы, распространённость заболеваний, структура медицинской документации и сама клиническая практика.
Иными словами, высокая точность внутри одной базы данных ещё не гарантирует воспроизводимости результата за её пределами.
Есть и методологическая проблема. В опубликованном анализе 71,7% рандомизированных исследований не сообщали о соблюдении каких-либо специальных стандартов отчётности. В 82,3% испытаний авторы сообщали благоприятные результаты, однако исследователи одновременно обнаружили частые проблемы с сокрытием распределения участников по группам и ослеплением.
Поэтому следующий этап развития медицинского ИИ — не просто увеличение числа испытаний, а переход к многоцентровым исследованиям, внешней проверке и более прозрачной методологии.
С большими языковыми моделями разрыв между публикациями и реальной медициной ещё заметнее
Отдельный анализ, опубликованный в Nature Medicine в марте 2026 года, позволяет увидеть ту же проблему на примере больших языковых моделей.
Исследователи обнаружили 4609 работ об использовании таких моделей в клинической медицине, опубликованных с января 2022 по сентябрь 2025 года. Это примерно 3,2 публикации в день.
Однако только 1048 исследований использовали реальные данные пациентов. Большая часть остальных проверяла модели на симулированных клинических ситуациях, экзаменационных заданиях и других искусственно созданных задачах.
До проспективных рандомизированных исследований дошли лишь 19 работ.
Есть ещё одна показательная деталь. В 1046 исследованиях, где большие языковые модели непосредственно сравнивались с людьми, модели превосходили человека в 33% сравнений. Но преимущество уменьшалось по мере роста реалистичности задачи и профессионального уровня специалиста, с которым сравнивали систему.
Это важное предупреждение против распространённой ошибки: хороший результат ИИ на медицинском экзамене не равен доказанной способности улучшать лечение пациентов.
Почему медицинские данные важнее следующего увеличения модели
Из этих результатов не следует, что развитие более мощных моделей перестало иметь значение. Но в медицине вычислительная мощность быстро перестаёт быть единственным ограничением.
Модель учится на том, что ей доступно. Если данные собраны преимущественно в нескольких крупных клиниках, плохо отражают другие группы населения, содержат систематические ошибки или отличаются от информации, которую алгоритм встретит после внедрения, увеличение числа параметров само по себе проблему не решит.
Есть и более глубокий уровень. Медицинские данные не являются нейтральной фотографией биологии человека. Они отражают то, кого обследовали, какие анализы назначали, каким пациентам был доступен специалист, какие диагнозы врачи искали чаще и как устроена конкретная система здравоохранения.
Поэтому медицинскому ИИ нужны не просто большие массивы информации, а качественные, разнообразные, репрезентативные и независимо проверенные данные.
Но и этого недостаточно. Для клинического применения необходимо показать, что система работает после изменения больницы, оборудования и состава пациентов, а затем проверить, улучшает ли её использование значимые результаты лечения.
- Крах лабораторных иллюзий: почему точность медицинского ИИ падает втрое при столкновении с пациентом
- GPT-5 наследует системные ошибки и предвзятость в медицине
Контекст рынка и отрасли:
Главный барьер начинается там, где алгоритм встречается с реальной больницей
Для пациента вопрос в конечном счёте заключается не в том, насколько впечатляюще алгоритм выглядит в научной публикации. Важно, уменьшает ли он число пропущенных диагнозов, помогает ли выбрать лечение, снижает ли риск осложнений или делает медицинскую помощь быстрее и доступнее без появления новых ошибок.
Для врача значение имеет ещё и взаимодействие человека с системой. Даже достаточно точный алгоритм способен принести мало пользы, если его предупреждения постоянно игнорируются, рекомендации плохо встроены в рабочий процесс или специалист начинает чрезмерно доверять автоматическому ответу.
Показательный пример появился в 2026 году в Nature Communications. В рандомизированной оценке предварительного отбора пациентов для онкологических клинических исследований сочетание человека и ИИ повысило общую точность анализа медицинских карт примерно с 71% до 76%. При этом время обработки практически не изменилось, а ИИ без человека работал заметно хуже обеих групп.
Это иллюстрирует возможную модель будущего лучше, чем противопоставление «врач или искусственный интеллект». В некоторых задачах основной эффект может возникать именно при правильно организованной совместной работе человека и алгоритма.
Следовательно, медицинскому ИИ предстоит пройти тот же путь, который медицина требует от других вмешательств: внешняя проверка, проспективные исследования, сравнение с существующей практикой, оценка безопасности, пользы и стоимости, а затем наблюдение после внедрения.
ИИ уже умеет находить закономерности в изображениях, текстах, геномах и медицинских записях. Теперь начинается более трудная стадия: доказать, что эти способности сохраняются в разных больницах, помогают врачам принимать лучшие решения и в конечном счёте улучшают результаты для пациентов.
Именно здесь главным ресурсом становятся не только более мощные модели. Нужны качественные и разнообразные медицинские данные, независимая внешняя проверка, многоцентровые испытания и исследования реального клинического эффекта.
Следующая гонка медицинского ИИ будет идти не только за количеством параметров. Она будет идти за качеством доказательств.
Для профессионального сообщества:
Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.
Источники и материалы
- Wang Q. et al. A quantitative analysis of global AI medical studies: gaps in randomized controlled trials. npj Digital Medicine, 2026
- PubMed: A quantitative analysis of global AI medical studies: gaps in randomized controlled trials
- Chen S.F. et al. LLM-assisted systematic review of large language models in clinical medicine. Nature Medicine, 2026
- Human-AI teaming to improve accuracy and efficiency of eligibility criteria prescreening for oncology trials: a randomized evaluation trial using retrospective electronic health records. Nature Communications, 2026
- Inventorus: обзор данных об использовании искусственного интеллекта в медицинских исследованиях, публикация CNews от 17 сентября 2026 года


