Рак мочевого пузыря оставляет следы в медкарте за годы до диагноза
ИИ нашёл комбинацию из 38 признаков, которая видит риск там, где один симптом мало что говорит
Исследователи проанализировали электронные медицинские карты почти 70 000 человек и обнаружили, что признаки будущего рака мочевого пузыря могут появляться задолго до официального диагноза. Разработанная ими система PRECISE-AGZ не ищет один «симптом рака»: она складывает вместе десятки фрагментов истории пациента — от крови в моче и курения до диагнозов, обследований и назначенных лекарств. Лучше всего модель работала в последний год перед диагнозом, поэтому речь пока не о готовом пятилетнем тесте, а о новом способе увидеть скрытый рисунок болезни в уже существующих медицинских данных.

Главная проблема — самый известный симптом рака совсем не специфичен
Кровь в моче, или гематурия, — один из главных тревожных признаков рака мочевого пузыря. Но одновременно она встречается при инфекциях мочевых путей, камнях, доброкачественном увеличении простаты и других состояниях.
Получается неудобная диагностическая ситуация. Игнорировать гематурию нельзя, но сама по себе она ещё далеко не означает рак.
Именно поэтому сегодня врачу приходится решать не только вопрос «есть ли кровь в моче?», но и гораздо более сложный: насколько вероятно, что именно у этого пациента за ней скрывается опухоль.
Окончательная диагностика часто требует цистоскопии — исследования, при котором через мочеиспускательный канал в мочевой пузырь вводят тонкий инструмент с камерой. Это чрезвычайно полезная процедура, но она инвазивна, неприятна для пациента и не подходит в качестве простого массового скрининга.
Авторы нового исследования предложили посмотреть на проблему совершенно иначе.
Вместо одного симптома — вся медицинская история
Команда под руководством исследователей Университета Плимута использовала валлийскую базу SAIL, объединяющую обезличенные данные первичной и специализированной медицинской помощи.
Для разработки и тестирования модели использовали данные 64 884 человек за 1995–2018 годы: 11 057 пациентов с раком мочевого пузыря и 53 827 человек контрольной группы. Затем систему отдельно проверили на более поздней группе за 2019–2020 годы — 783 случаях рака и 3786 контрольных пациентах.
Но особенно интересен масштаб исходной задачи.
В электронных картах оказалось 48 261 потенциально полезных признака. Это симптомы, диагнозы, процедуры, лекарства и другие элементы медицинской истории.
Из этого огромного массива алгоритм отобрал всего 38 признаков, которые вместе лучше всего помогали различать пациентов с раком и без него.
И здесь находится главный смысл работы: компьютер искал не «новый симптом рака». Он искал комбинацию слабых сигналов, каждый из которых по отдельности может практически ничего не означать.
Как ИИ нашёл 38 признаков среди 48 тысяч
Авторы назвали свою систему PRECISE-AGZ. За сложным названием скрывается довольно понятная логика.
Сначала алгоритм должен был справиться с особенностью медицинских карт: некоторые события встречаются чрезвычайно часто, а потенциально важные сигналы — редко. Если просто считать частоту записей, рутинные процедуры способны заглушить редкие, но информативные признаки.
Исследователи поэтому применили специальное взвешивание признаков, а затем метод отбора, основанный на так называемой роевой оптимизации.
Название происходит от математических алгоритмов, имитирующих коллективный поиск решения множеством отдельных «частиц». В данном случае задача была практической: из десятков тысяч переменных найти небольшую комбинацию, которая сохраняет максимум диагностической информации.
После отбора исследователи использовали логистическую регрессию — относительно прозрачную статистическую модель. Это важно: в медицине недостаточно получить ответ от «чёрного ящика». Желательно понимать, какие признаки повлияли на результат.
Именно поэтому авторы дополнительно применяли методы интерпретации машинного обучения, включая SHAP, позволяющие оценить вклад отдельных признаков в прогноз.
И вот здесь обнаружилось самое интересное
Гематурия действительно оказалась сильнейшим предиктором. Курение также подтвердило свою известную связь с раком мочевого пузыря.
То есть алгоритм сначала нашёл то, что врачи уже знают.
Но затем выяснилось нечто гораздо важнее: значение одного и того же симптома менялось в зависимости от остальной истории пациента.
Например, сочетание гематурии с доброкачественным увеличением простаты у мужчин в этой выборке было связано с меньшей вероятностью рака, чем можно было ожидать, рассматривая кровь в моче изолированно.
И наоборот, инфекции мочевых путей были связаны с повышенной вероятностью заболевания.
Проще говоря, вопрос перестаёт звучать как:
«Есть ли у человека кровь в моче?»
Он становится другим:
«У какого именно человека появилась кровь в моче и что происходило с его здоровьем до этого?»
Именно это принципиально отличает подобную модель от простого списка симптомов.
Медицинская карта может содержать сигналы, которые человек никогда не заметит
Алгоритм обнаружил и гораздо более неожиданные ассоциации.
Болезнь Паркинсона и некоторые органические психические расстройства оказались отрицательно связаны с раком мочевого пузыря. В исходных данных болезнь Альцгеймера также чаще встречалась в контрольной группе.
Среди лекарственных признаков появились флуоксетин, антибиотики, применяемые при инфекциях мочевых путей, карбоцистеин и тамоксифен.
Особое внимание привлёк тамоксифен: длительная история его назначения была связана с более высокой вероятностью рака мочевого пузыря.
Но здесь особенно важно не перепутать прогнозирование с причинностью.
Исследование не показывает, что болезнь Паркинсона защищает от рака мочевого пузыря. И оно не доказывает, что тамоксифен вызывает этот рак.
Алгоритм обнаружил статистические связи, полезные для распознавания определённого профиля пациента. За ними могут стоять биологические механизмы, особенности лечения, другие заболевания, различия в обращаемости к врачам или факторы, которые исследование вообще не измеряло.
Авторы прямо называют эти находки поводом для дальнейших исследований, а не доказанными причинно-следственными связями.
«85% обнаруженных случаев» требует важного пояснения
Одна из самых впечатляющих цифр исследования — чувствительность 85,2% при специфичности 91,2% на тестовой выборке.
Чувствительность показывает, какую долю заболевших модель смогла распознать. Специфичность — какую долю людей без заболевания она правильно отнесла к группе без высокого риска.
Однако эти показатели относятся не ко всей выборке без исключения.
PRECISE-AGZ специально использует так называемую серую зону.
Модель разделяет людей на три категории:
- низкий риск — прогнозируемая вероятность ниже 7%;
- неопределённая зона — от 7% до 55%;
- высокий риск — выше 55%.
При указанной конфигурации модель уверенно классифицировала только 34,5% тестовой выборки. Остальные попадали в серую зону.
На первый взгляд это может показаться недостатком. На самом деле именно здесь заложена одна из наиболее разумных идей исследования.
Иногда хороший медицинский алгоритм должен уметь сказать «не знаю»
Обычная модель вынуждена провести границу: с одной стороны «рак», с другой — «не рак».
Но биология редко настолько аккуратна.
Авторы PRECISE-AGZ сознательно оставили пространство неопределённости. Если накопленных данных недостаточно, система не должна искусственно превращать сомнение в уверенный диагноз.
Для пациентов с высоким риском это потенциально позволяет быстрее назначать дальнейшее обследование. Для низкого риска — в будущем, если подход будет подтверждён, может помочь избежать части ненужных инвазивных исследований. А неопределённые случаи остаются зоной для дальнейшей оценки врачом.
Особенно это важно именно при раке мочевого пузыря: цена ложной тревоги может включать ненужную цистоскопию, а цена пропущенного сигнала — позднюю диагностику опухоли.
За сколько времени до рака действительно работает модель
Именно здесь формулировку «ИИ обнаруживает рак за пять лет» необходимо использовать осторожно.
Исследователи действительно проверяли модель, последовательно убирая из медицинских карт события последних месяцев перед официальным диагнозом. Так они моделировали ситуацию, будто алгоритм запускается раньше — вплоть до 60 месяцев, то есть пяти лет.
Чем дальше от момента диагноза, тем слабее становился сигнал.
За месяц до диагноза чувствительность составляла 87,2%, а специфичность — 88,3%. За 12 месяцев чувствительность оставалась 66,7%, при специфичности 97,7%.
Одновременно уменьшалась доля пациентов, которых модель могла уверенно вывести из серой зоны: с 29,9% за месяц до диагноза до 12,7% за год.
Авторы сообщают, что определённые сигналы сохранялись и за несколько лет до диагноза. Но наиболее убедительные количественные результаты относятся к последним 12 месяцам.
Поэтому правильнее сказать так: медицинская история действительно может содержать распознаваемый рисунок заболевания задолго до диагноза, однако чем раньше пытается смотреть алгоритм, тем меньше информации у него остаётся.
Почему электронная медкарта неожиданно становится диагностическим инструментом
Обычно мы воспринимаем медицинскую карту как архив прошлого: диагнозы, рецепты, анализы, обращения к врачу.
Это исследование показывает другую возможность.
Взятые по отдельности записи могут казаться совершенно несвязанными. Но если объединить десятилетия наблюдений тысяч пациентов, становятся видны статистические комбинации, которые человеческому врачу практически невозможно вычислить самостоятельно.
Врач видит конкретного пациента.
Алгоритм одновременно сравнивает его историю с паттернами, обнаруженными в десятках тысяч других историй.
Это не замена клинического мышления. Это дополнительный слой информации, который потенциально способен показать врачу, что обычная последовательность событий стала необычной именно в их сочетании.
Почему завтра такой скрининг в поликлинике не появится
Исследование остаётся ранним этапом разработки.
Во-первых, это исследование типа «случай–контроль», а обнаруженные связи не позволяют устанавливать причины.
Во-вторых, все данные происходили из одной системы здравоохранения — валлийской базы SAIL. Медицинские записи, структура назначений, правила направления пациентов и кодирование заболеваний отличаются между странами.
Модель необходимо независимо проверить на других популяциях и в других системах здравоохранения.
В-третьих, значительная часть пациентов оказывается в серой зоне. Для реального массового скрининга это серьёзный вопрос: алгоритм должен не только хорошо распознавать крайние случаи, но и приносить измеримую пользу реальным пациентам.
Наконец, исследование проверяет способность модели распознавать паттерн перед уже известным диагнозом. Следующий принципиальный этап — показать в независимом проспективном исследовании, что использование такого алгоритма действительно приводит к более ранней диагностике и улучшает клинические результаты.
- Рак поджелудочной больше не «невидим»: ИИ находит его за 1,5 года до диагноза
- Алгоритмический прорыв в онкологии: как ИИ Сеченовского университета обнуляет дефицит патоморфологов
Контекст рынка и отрасли:
Что это меняет для пациента сегодня
Пока PRECISE-AGZ — исследовательская система, а не медицинский тест, которым человек может воспользоваться самостоятельно.
Она не меняет и существующего отношения к гематурии. Видимая кровь в моче требует медицинской оценки, даже если она появилась один раз и даже если существуют вполне доброкачественные возможные объяснения.
Но исследование меняет сам взгляд на раннюю диагностику.
Будущий скрининг некоторых заболеваний может заключаться не только в новом анализе крови, сканировании или биомаркере. Часть информации уже может находиться в медицинской карте — просто в таком распределённом виде, что человек не способен увидеть её как единый сигнал.
Для профессионального сообщества:
Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.
Источники и материалы
- Early Detection of Bladder Cancer Using Advanced Feature Engineering and Swarm Intelligence Optimization on EHRs
- PubMed: Early Detection of Bladder Cancer Using Advanced Feature Engineering and Swarm Intelligence Optimization on EHRs
- University of Plymouth: Bladder cancer detected up to five years before diagnosis – thanks to AI
- NICE: Suspected cancer: recognition and referral


