Медицинский ИИ упирается в дефицит данных пациентов

Главный дефицит медицинского ИИ — не алгоритмы, а доступ к качественным данным пациентов

Директор по развитию технологий искусственного интеллекта Т-Технологий Алексей Шпильман заявил на Восточном экономическом форуме, что одним из главных ограничений для развития ИИ в онкологии остается доступ к медицинским данным — диагнозам, изображениям и связанным с ними клиническим сведениям. Эта проблема носит глобальный характер: Национальный институт рака США прямо называет нехватку крупных, качественно размеченных и доступных онкологических наборов данных существенным барьером для разработки ИИ. Однако решение состоит не в простой передаче разработчикам медицинских архивов. Международная практика движется к регулируемому вторичному использованию данных, защищенным вычислительным средам и федеративному обучению, при котором информация пациента вообще не обязана покидать медицинскую организацию.

Онколог, радиолог и специалист по медицинским данным обсуждают применение медицинского ИИ в онкологии и защищенный доступ к данным пациентов
Медицинскому ИИ нужны не просто снимки, а связанные клинические данные — от диагноза до результатов лечения.

ИИ научился на интернете тому, чему медицина не может научить его так же просто

2 сентября 2026 года на Восточном экономическом форуме Алексей Шпильман сформулировал проблему медицинского искусственного интеллекта через контраст с генеративными моделями. Современные системы смогли быстро развиваться благодаря огромным массивам текстов, изображений и других материалов, доступных в интернете. С медицинскими данными такой путь практически невозможен.

Диагноз, компьютерная томограмма, цифровое изображение биопсии, результаты лабораторных исследований, схема лечения и дальнейшая судьба пациента — чувствительная персональная информация. Она распределена между больницами и информационными системами, регулируется законодательством и не может просто собираться разработчиком так же, как открытые интернет-данные.

Именно поэтому тезис Шпильмана выходит далеко за пределы российского рынка. Национальный институт рака США ранее также называл отсутствие крупных публично доступных и качественно размеченных онкологических наборов данных существенным препятствием для исследований ИИ, воспроизводимости результатов и независимой проверки алгоритмов.

Проблема при этом не сводится к количеству информации. Для медицинской модели особенно важна связь между разными типами данных. Снимок опухоли становится намного ценнее для обучения, если известно, какой диагноз был подтвержден, какие молекулярные характеристики имела опухоль, какое лечение получил человек и чем закончилась терапия.

Иными словами, медицине нужны не просто миллионы изображений. Ей нужны качественные, стандартизированные и клинически осмысленные истории болезни.

Онкология особенно зависима от масштаба и разнообразия данных

Онкология хорошо показывает, почему один даже очень крупный медицинский центр не всегда способен самостоятельно создать универсальную модель.

Рак — не одна болезнь. Опухоли различаются по органу происхождения, гистологическому типу, молекулярным нарушениям, стадии и реакции на лечение. Некоторые клинически важные подгруппы настолько малы, что для накопления достаточного числа наблюдений приходится объединять информацию из многих учреждений и стран.

Есть и другая проблема. Алгоритм может прекрасно работать в больнице, на данных которой его обучали, но хуже — в другом медицинском центре. Отличаются аппараты компьютерной и магнитно-резонансной томографии, лабораторные методы, протоколы исследований, характеристики пациентов и даже способы ведения медицинской документации.

Поэтому ценность большого массива состоит не только в числе пациентов. Разнообразие данных позволяет проверить, распознает ли алгоритм действительно медицински значимую закономерность или случайную особенность конкретной больницы и ее оборудования.

Показателен международный проект atomCAT, результаты которого были опубликованы в Nature Communications в 2026 году. Исследователи использовали федеративное обучение для построения прогностических моделей при раке анального канала — сравнительно редком заболевании. Обучение охватывало 14 центров и данные 1428 пациентов, а внешняя проверка проводилась еще в двух центрах на 277 пациентах.

Такие проекты демонстрируют принципиальное преимущество распределенных медицинских данных: редкие группы пациентов перестают быть слишком малыми для анализа, когда несколько клиник получают возможность работать совместно.

Федеративное обучение позволяет перемещать алгоритм, а не историю болезни

Предложение открыть доступ к медицинским данным легко понять неправильно. Для развития медицинского ИИ совсем не обязательно создавать гигантскую базу, куда будут физически стекаться истории болезни миллионов людей.

При федеративном подходе происходит обратное: алгоритм направляется туда, где находятся данные.

При обычной централизованной схеме данные нескольких больниц копируются в общее хранилище, после чего модель обучается на объединенном массиве. При федеративном подходе алгоритм направляется туда, где находятся данные.

Каждая медицинская организация локально обучает модель на собственной информации. Затем передаются обновленные параметры модели, которые объединяются с результатами других участников. Исходные снимки и медицинские записи при этом остаются внутри учреждения.

В 2025 году систематический обзор исследований федеративного обучения при раке молочной железы, легкого и предстательной железы показал, что эта технология уже вышла далеко за пределы теоретической концепции. Авторы проанализировали 25 исследований; в 15 из них федеративные модели превосходили сравниваемые централизованные модели, хотя результаты существенно зависели от конкретной задачи и устройства исследования.

В 2026 году другой международный проект показал возможность развертывания федеративного обучения для анализа цифровых гистологических изображений в трех университетских клиниках Германии непосредственно за больничными межсетевыми экранами. Это важная деталь: медицинский ИИ постепенно учится работать внутри существующей защищенной инфраструктуры, а не требовать ее демонтажа ради доступа к данным.

Но федеративное обучение не означает автоматической конфиденциальности. Передаваемые параметры модели в некоторых обстоятельствах тоже могут раскрывать информацию, поэтому необходимы дополнительные механизмы защиты, контроль доступа, аудит и четкие правила управления данными.

Даже защищенный доступ не решает проблему плохих данных

Если завтра открыть исследователям доступ к огромному числу медицинских записей, это само по себе не создаст качественный медицинский ИИ.

Данные разных больниц могут быть неполными и несовместимыми. Один и тот же диагноз кодируется по-разному, исследования выполняются на различном оборудовании, клинические показатели измеряются неодинаковыми методами, а исход лечения может вообще отсутствовать в доступной системе.

Для обучения алгоритма имеет значение и качество разметки. Чтобы система училась распознавать опухоль на изображении, требуется надежно установленная связь между изображением и диагнозом. Для прогнозирования эффективности лечения нужны сведения не только о назначенном препарате, но и о характеристиках опухоли, сопутствующих заболеваниях, предыдущей терапии и последующем наблюдении.

Существует также риск систематической ошибки. Если в обучающем массиве непропорционально представлены определенные возрастные, этнические или социальные группы либо данные поступают преимущественно из крупных академических центров, модель может хуже работать на пациентах, которых она редко встречала при обучении.

ВОЗ поэтому рассматривает управление медицинскими данными как часть безопасности ИИ, а не только как юридический вопрос. Данные должны быть качественными, репрезентативными и полученными с соблюдением этических требований. Без этого увеличение их объема способно масштабировать не только возможности алгоритма, но и ошибки.

Европа строит инфраструктуру, в которой медицинские данные можно использовать повторно

Особенно показательно развитие Европейского пространства медицинских данных — European Health Data Space (EHDS). Соответствующий регламент вступил в силу 26 марта 2025 года, а его применение будет вводиться поэтапно.

Одна из центральных идей EHDS — вторичное использование медицинских данных. Это означает, что информация, первоначально собранная для лечения конкретного человека, при соблюдении установленных правил сможет повторно использоваться для исследований, инноваций, общественного здравоохранения и деятельности регуляторов.

Именно такой механизм потенциально необходим медицинскому ИИ.

Европейская комиссия прямо указывает, что разработка и внедрение ИИ требуют разнообразных и качественных медицинских данных для обучения, тестирования и оценки алгоритмов. При этом доступ должен происходить не путем свободной передачи баз данных компаниям, а через регулируемую инфраструктуру.

Предусмотрены специальные органы доступа к медицинским данным, минимизация объема предоставляемой информации, анонимизация или псевдонимизация и работа в защищенных вычислительных средах. Вторичное использование большинства категорий электронных медицинских данных по правилам EHDS должно начать применяться с марта 2029 года, а для некоторых категорий, включая геномные данные, — позднее.

Таким образом, международный тренд заключается не столько в «открытии медицинских данных», сколько в создании правил, позволяющих вычислениям безопасно добраться до данных.

Публичные онкологические архивы показывают и возможности, и пределы открытого доступа

Часть этой инфраструктуры уже существует.

Национальный институт рака США развивает Cancer Research Data Commons, объединяющий различные виды онкологических исследовательских данных. Его Imaging Data Commons представляет собой облачное хранилище открытых данных медицинской визуализации.

В нем доступно более 100 терабайт информации, включая радиологические изображения, цифровую патологию, разметку, сегментацию опухолей, количественные показатели и сопутствующие клинические сведения. Другой крупный ресурс — The Cancer Imaging Archive — с 2011 года публикует деидентифицированные и тщательно подготовленные онкологические изображения для исследовательского использования.

Такие ресурсы чрезвычайно важны для разработки и воспроизводимости исследований. Но они не заменяют огромный объем информации, который ежедневно возникает в реальной клинической практике.

Большая часть потенциально ценных данных остается внутри больничных информационных систем. Именно соединение исследовательских архивов с безопасными механизмами анализа повседневной клинической информации может стать следующим этапом развития медицинского ИИ.

Для пациентов главный вопрос — не «отдавать ли данные», а кто и на каких условиях сможет их использовать

Практическое значение дискуссии вокруг медицинских данных значительно шире разработки очередного алгоритма распознавания изображений.

Для пациента качественно обученные модели потенциально могут означать более точный анализ диагностических изображений, выявление закономерностей в сложных сочетаниях клинических данных, более надежную оценку прогноза и поддержку персонализированного выбора лечения. Особенно ценными подобные системы могут оказаться при редких опухолях и небольших молекулярных подгруппах, где отдельному медицинскому центру трудно накопить достаточный опыт.

Для врачей ценность будет определяться не впечатляющими лабораторными показателями алгоритма, а тем, улучшает ли система реальные клинические решения. Национальный институт рака США подчеркивает необходимость внешней проверки моделей, понимания их неопределенности и оценки влияния на клинические исходы, опыт пациентов и стоимость помощи.

Для систем здравоохранения возникает более сложная задача. Им необходимо одновременно сделать данные пригодными для исследований и сохранить доверие пациентов. Это требует технической защиты, прозрачных правил доступа, контроля целей использования и возможности устанавливать ответственность при нарушениях.

Поэтому изменение законодательства, о котором говорил Алексей Шпильман, может быть только одной частью решения. Не менее важны стандартизация медицинских данных, совместимость информационных систем, качество разметки, защищенная вычислительная инфраструктура и независимая оценка создаваемых алгоритмов.

Главный вопрос следующего этапа медицинского ИИ заключается уже не в том, существуют ли необходимые алгоритмы. Он заключается в том, смогут ли системы здравоохранения превратить миллиарды разрозненных медицинских записей в исследовательский ресурс, не превращая пациента в неконтролируемый источник данных.

Синтез от АПТЕКИУМ: Медицинский ИИ сталкивается с парадоксом: самые ценные данные для его развития существуют в огромных количествах, но именно они меньше всего доступны для обучения. Решением становится не безусловное открытие медицинских архивов, а новая архитектура работы с ними — регулируемый вторичный доступ, защищенные вычислительные среды, стандартизация и федеративное обучение. Поэтому следующий большой скачок ИИ в онкологии может зависеть не столько от появления еще более мощной модели, сколько от способности медицины научиться безопасно объединять знания, которые сегодня остаются разделенными между тысячами больниц.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.