ИИ выбирает метод коррекции зрения: насколько его решения совпадают с врачами

ИИ научился выбирать способ коррекции зрения — но 98,5% точности ещё не делают его хирургом

Крупное исследование почти 12 тысяч пациентов показало, что современные языковые модели способны по предоперационным данным оценивать пригодность человека для нескольких видов рефракционной хирургии на уровне, сопоставимом с врачом средней квалификации. Для относительно простого решения «подходит или не подходит» лучшие модели превысили 98,5% точности. Но когда задача становилась ближе к реальной клинике — требовалось выбрать между несколькими вариантами операции и оценить степень их предпочтительности — согласие с опытными хирургами заметно снижалось. Поэтому исследование говорит скорее о появлении перспективного инструмента поддержки врача, чем о возможности доверить чат-боту выбор операции.

Диагностика роговицы перед коррекцией зрения: данные обследования используются для оценки методов рефракционной хирургии с помощью ИИ
Точность ИИ превысила 98,5% в простых задачах пригодности, но выбор между несколькими операциями оказался значительно сложнее.

Почти 12 тысяч пациентов вместо экзаменационных вопросов

Большинство исследований медицинских языковых моделей устроено сравнительно просто: системе предлагают набор экзаменационных вопросов или клинических задач и проверяют, насколько часто она выбирает правильный ответ. Такой эксперимент показывает медицинские знания модели, но довольно слабо имитирует реальную работу врача.

Исследователи из West China Hospital Сычуаньского университета пошли дальше. В опубликованной 25 сентября 2026 года в BMC Medicine работе они использовали предоперационные данные 11 966 последовательных пациентов, проходивших обследование для рефракционной хирургии.

Это важно: модели работали не с несколькими сотнями специально отобранных учебных вопросов, а с большой выборкой реальных клинических данных.

Перед ними поставили задачу, с которой регулярно сталкивается офтальмохирург: определить, подходит ли конкретному человеку тот или иной способ коррекции зрения.

Оценивались четыре варианта:

  • фемтосекундный LASIK — лазерная коррекция с формированием роговичного лоскута;
  • SMILE — удаление сформированной лазером небольшой линзы ткани роговицы через малый разрез;
  • TransPRK — поверхностная лазерная коррекция без формирования лоскута;
  • ICL — имплантация внутрь глаза дополнительной колламерной линзы.

Это принципиально разные вмешательства. Их выбор зависит не только от количества диоптрий, но и от толщины и формы роговицы, глубины передней камеры глаза, возраста пациента и других характеристик.

Пять языковых моделей сравнили с тремя опытными хирургами

В эксперимент вошли DeepSeek-Chat, GLM-4.7, GPT-4o, Kimi-K2-Thinking и Qwen-Max.

Сначала три опытных специалиста по рефракционной хирургии независимо оценили пациентов. Они определяли пригодность каждого из четырех вмешательств и присваивали им баллы от 0 до 100.

Согласие между экспертами оказалось высоким: коэффициент каппа превышал 0,85. Этот показатель оценивает, насколько совпадение решений превосходит то, которое могло бы возникнуть случайно.

Сформированное таким образом экспертное мнение использовали как эталон, с которым затем сравнивали ответы искусственного интеллекта.

Для дополнительного человеческого ориентира те же данные независимо оценивал офтальмолог средней квалификации.

Именно здесь возникает важная оговорка. В исследовании ИИ не соревновался с хирургом у операционного стола и не принимал окончательное решение о лечении пациента. Он воспроизводил рекомендации экспертов на основании структурированных предоперационных данных.

Это гораздо более узкая задача.

Откуда появились впечатляющие 98,5%

Самая заметная цифра исследования — точность выше 98,5%.

Но без объяснения она легко вводит в заблуждение.

Такой результат относится прежде всего к бинарной классификации для LASIK и SMILE: модели должны были определить, подходит конкретная процедура пациенту или нет. У лучших систем площадь под ROC-кривой, то есть показатель способности различать подходящих и неподходящих кандидатов, превышала 0,96.

Для хорошо структурированной задачи это действительно сильный результат.

Однако клиническое решение редко заканчивается вопросом «можно ли делать LASIK?». Нередко человеку технически подходят несколько способов коррекции. Тогда врачу необходимо определить, какой из них предпочтительнее и насколько убедительны аргументы в пользу каждого варианта.

Именно здесь результаты становятся значительно менее впечатляющими.

Когда исследователи перешли к многокатегориальной оценке, максимальный коэффициент каппа у Qwen-Max достигал 0,743. Это уже хорошее, но далеко не почти идеальное согласие.

Разница между этими двумя результатами и есть, вероятно, главный вывод работы.

ИИ сравнительно хорошо распознаёт четкие границы пригодности, но хуже справляется с зоной, где медицина превращается из классификации в выбор между несколькими разумными решениями.

Почему выбор операции сложнее, чем решение «можно — нельзя»

Рефракционная хирургия хорошо показывает фундаментальную проблему медицинского ИИ.

Часть врачебных решений можно представить как последовательность правил. Если определенные показатели находятся за установленными пределами, конкретное вмешательство становится нежелательным или противопоказанным.

Для алгоритма такая структура удобна.

Но между очевидным противопоказанием и очевидно подходящим пациентом существует большая промежуточная зона.

Например, человеку могут подходить и SMILE, и LASIK. Тогда значение приобретают различия в анатомии глаза, предполагаемый риск осложнений, особенности образа жизни, ожидания пациента, опыт хирурга и преимущества конкретной технологии.

Формально правильных решений может быть несколько.

Поэтому снижение согласия моделей при многокатегориальном выборе — не второстепенная статистическая деталь. Оно показывает границу между распознаванием клинических критериев и полноценным индивидуальным медицинским решением.

Qwen-Max и DeepSeek лучше воспроизводили экспертные оценки

Авторы оценивали не только правильность категорий, но и способность моделей воспроизводить числовые оценки хирургов.

Здесь особенно хорошо показали себя Qwen-Max и DeepSeek-Chat: их оценки сильно коррелировали с экспертными.

Qwen-Max продемонстрировал наиболее высокое согласие с экспертами в более сложной многокатегориальной классификации. DeepSeek-Chat, в свою очередь, выделился сочетанием точности, скорости и стоимости обработки запросов.

В рамках условий исследования он оказался самым экономически эффективным из пяти протестированных вариантов. GPT-4o был самым дорогим.

Это имеет значение не столько для отдельного пациента, сколько для потенциального использования подобных систем в клиниках. Если алгоритм должен предварительно анализировать десятки или сотни тысяч обследований, стоимость каждого обращения к модели превращается в самостоятельный параметр медицинской технологии.

Китайское исследование и китайские модели: повод для проверки, но не доказательство предвзятости

На результаты стоит посмотреть и с другой стороны. Работа выполнена исследователями West China Hospital Сычуаньского университета, а среди наиболее сильных результатов оказались китайские Qwen-Max и DeepSeek-Chat.

Само по себе это не позволяет говорить о предвзятости исследования.

Авторы сообщают, что работа не получала специального финансирования, а конфликтов интересов они не заявили. Кроме того, преимущество китайских моделей не было универсальным: разные системы показывали разные результаты в зависимости от типа задачи.

Есть и более широкий контекст. Независимое исследование, опубликованное в журнале Vision в 2025 году, сравнивало семь языковых моделей на экзаменационных вопросах по оптике и рефракционной хирургии. Там лучший общий результат показала модель OpenAI o1 — 83,6%, тогда как DeepSeek V3 набрал около 70%. При этом именно в вопросах, относящихся к рефракционной хирургии, DeepSeek V3 показывал особенно сильный результат.

Иными словами, нет устойчивого правила, согласно которому китайские модели обязательно превосходят западные в офтальмологии.

Гораздо важнее другое ограничение нынешней работы: результаты одной клинической базы нельзя автоматически переносить на пациентов других клиник, стран и популяций.

Для медицинского ИИ внешняя проверка особенно важна. Модель может хорошо воспроизводить решения специалистов конкретного центра, но это ещё не означает, что она сохранит результат при других диагностических приборах, протоколах обследования, критериях отбора пациентов и хирургических подходах.

ИИ здесь не смотрит пациенту в глаза

Есть ещё одно принципиальное различие между экспериментом и настоящим приемом.

Модель получала структурированную клиническую информацию. Она не проводила обследование, не проверяла качество исходных измерений, не разговаривала с пациентом и не несла ответственности за последствия рекомендации.

Поэтому формулировка «ИИ выбирает операцию лучше врача» была бы некорректной.

Исследование проверяло гораздо более конкретную способность: насколько хорошо языковая модель может воспроизводить решение экспертной группы, когда необходимые предоперационные данные уже собраны и представлены ей в стандартизированной форме.

Именно в такой роли технология выглядит наиболее реалистично.

Самая близкая перспектива — второй цифровой взгляд перед операцией

Практическая ценность подобных систем может появиться задолго до того, как кому-либо придёт в голову доверять им окончательное хирургическое решение.

Модель может предварительно проверять данные обследования, отмечать очевидно неподходящие варианты вмешательства, ранжировать возможные процедуры и обращать внимание врача на случаи, где решение неоднозначно.

В крупных офтальмологических центрах это способно сократить объем рутинной работы. В системах здравоохранения с нехваткой специалистов такой инструмент потенциально может использоваться для предварительного отбора пациентов перед консультацией хирурга.

Но для этого потребуется гораздо больше, чем высокая точность в ретроспективном исследовании.

Необходима внешняя проверка на независимых клинических базах, желательно в разных странах и популяциях. Затем нужны проспективные исследования, в которых система используется в реальном лечебном процессе и оценивается не только совпадение с экспертами, но и влияние на ошибки, осложнения, эффективность работы врача и исходы пациентов.

Есть и отдельная проблема воспроизводимости. Коммерческие языковые модели регулярно обновляются. Система, протестированная сегодня, через несколько месяцев может отвечать иначе, хотя её название для пользователя почти не изменится. Для медицинского применения потребуется фиксировать версии моделей и контролировать изменения их поведения значительно строже, чем при обычном использовании чат-ботов.

Рефракционная хирургия показывает, где медицинский ИИ действительно полезен

Эта работа интересна не только офтальмологией.

Она демонстрирует более общий сценарий внедрения больших языковых моделей в медицину: не заменять врача целиком, а выделять из его работы структурированные задачи, которые машина способна выполнять быстро и достаточно надежно.

Особенно перспективны ситуации, где существуют стандартизированные измерения, понятные критерии пригодности и большой объем однотипных решений.

Но исследование одновременно показывает и предел такого подхода.

Чем дальше задача уходит от четкой классификации и чем больше в ней появляется нескольких приемлемых вариантов, индивидуальных обстоятельств и клинического суждения, тем заметнее преимущество человеческой экспертизы.

Синтез от АПТЕКИУМ: Цифра 98,5% выглядит как история о том, что искусственный интеллект почти научился заменять офтальмолога. Само исследование говорит о более интересном процессе: ИИ начинает уверенно осваивать отдельные элементы клинического решения, если задача хорошо структурирована и ему заранее предоставлены качественные медицинские данные. Настоящий рубеж пройдет не там, где модель научится ещё точнее отвечать «подходит или не подходит». Он пройдет там, где независимые клинические исследования покажут, что использование такой системы вместе с врачом действительно уменьшает количество ошибок и улучшает результаты лечения пациентов. Пока этого не произошло, 98,5% — впечатляющий результат алгоритмического теста, но не 98,5% гарантии правильного выбора операции.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.