Фармкомпании объединяют закрытые данные, чтобы научить ИИ отбирать антитела

ИИ для разработки антител упирается не в алгоритмы, а в данные: фармкомпании решили объединить то, чем обычно не делятся

AbbVie, argenx, Lundbeck и Takeda стали основателями Antibody Developability Consortium — проекта Ginkgo Datapoints и Apheris, который должен создать стандартизированный набор данных о 10 000 антителах и обучить на нём модели для раннего прогнозирования их разрабатываемости. Инициатива отвечает на одну из главных проблем ИИ в биофармацевтике: хорошие алгоритмы мало помогают, если обучаются на небольших, разнородных и плохо сопоставимых данных. Необычна и архитектура проекта: фармкомпании смогут совместно использовать ценность закрытых данных, не раскрывая друг другу сами проприетарные последовательности антител.

Автоматизированная лаборатория характеризации антител, где стандартизированные измерения создают данные для разработки антител с ИИ
Для обучения ИИ важен не только масштаб: тысячи антител должны проходить сопоставимые измерения по стандартизированным протоколам.

Найти антитело, связывающееся с мишенью, недостаточно

В разработке биологических препаратов есть принципиальная разница между молекулой, которая хорошо работает в эксперименте, и молекулой, из которой можно сделать лекарство.

Антитело может эффективно связываться с нужной мишенью, но одновременно плохо экспрессироваться при производстве, образовывать агрегаты, взаимодействовать само с собой или с посторонними молекулами, обладать недостаточной стабильностью либо создавать сложности при получении концентрированной лекарственной формы. Совокупность таких свойств называют разрабатываемостью антитела — developability.

Проблема становится особенно дорогой, если обнаруживается поздно. К этому моменту компания уже могла потратить значительные ресурсы на оптимизацию молекулы, доклинические исследования, разработку производственного процесса и подготовку клинической программы.

Поэтому отрасль старается перенести оценку разрабатываемости как можно ближе к началу поиска лекарства: не только спрашивать, действует ли молекула, но и заранее оценивать, насколько реально превратить её в производимый, стабильный и пригодный для применения препарат.

Именно здесь ИИ выглядит особенно привлекательным. Если физико-химические свойства можно достаточно точно предсказывать по последовательности антитела, тысячи кандидатов можно отсеивать вычислительно ещё до дорогостоящей лабораторной работы.

Но для этого алгоритму сначала нужно показать достаточно много антител, свойства которых действительно измерены.

Эксперимент 2025 года показал, где заканчиваются возможности современных моделей

Причина создания нового консорциума становится понятнее благодаря результатам Antibody Developability Competition, проведённого Ginkgo Datapoints в 2025 году и опубликованного в журнале mAbs в феврале 2026 года.

В соревновании участвовали 113 команд из 25 стран, представлявшие 38 компаний и 39 университетов. Модели обучались на данных о 246 клинических антителах, а затем проверялись на отдельном наборе из 80 ранее не виденных молекул.

Прогнозировались пять характеристик: гидрофобность, термостабильность, склонность антител взаимодействовать друг с другом, уровень экспрессии и полиреактивность — способность неспецифически связываться с различными молекулами.

Результаты оказались неодинаковыми. Лучшие модели относительно хорошо предсказывали гидрофобность: коэффициент ранговой корреляции Спирмена достигал 0,708. Для термостабильности максимум составлял 0,392, полиреактивности — 0,356, самоассоциации — 0,337, а уровня экспрессии — только 0,310.

Ещё важнее другое наблюдение. Результаты внутренней перекрёстной проверки систематически выглядели лучше, чем работа моделей на скрытом тестовом наборе.

Это классический признак ограниченной способности модели переносить выученные закономерности на действительно новые молекулы. Алгоритм может хорошо ориентироваться в пространстве, похожем на его обучающие данные, но заметно хуже работать там, где начинаются новые последовательности и свойства.

Авторы исследования связали проблему прежде всего с небольшими и неоднородными наборами экспериментальных данных.

10 000 антител нужны не ради рекорда

Antibody Developability Consortium пытается изменить именно эту часть системы.

Ginkgo Datapoints и Apheris заявили цель собрать данные о 10 000 антителах класса IgG. Компании-участники предоставят собственные последовательности, а недостающая часть будет дополнена публичными молекулами.

Однако масштаб — только половина замысла.

Для машинного обучения критически важно, чтобы характеристики разных молекул были измерены сопоставимым способом. Если одно антитело исследовали в одной лаборатории, другое — по иной методике, третье — при других условиях, алгоритм может начать изучать различия между экспериментами вместо фундаментальной связи между последовательностью и свойствами молекулы.

Ginkgo Datapoints поэтому будет не просто собирать существующие результаты. Компания отвечает за подбор последовательностей, производство антител и их высокопроизводительную характеристику по единому набору протоколов.

Её платформа PROPHET-Ab позволяет параллельно исследовать более 2400 конструкций и оценивать более десяти характеристик, включая агрегацию, термостабильность, гидрофобность, самоассоциацию, полиреактивность и ряд других параметров.

Таким образом, консорциум фактически строит не библиотеку найденных данных, а специально спроектированный обучающий материал для ИИ.

Конкуренты делятся ценностью данных, но не самими секретами

Есть очевидная причина, почему подобный набор данных не появился раньше.

Наиболее интересная информация об антителах находится не в научных публикациях, а внутри фармацевтических компаний. Это результаты многих лет поиска молекул, включая не только успешные препараты, но и кандидатов, которые никогда не дошли до клиники.

Именно неудачные и промежуточные молекулы особенно полезны для обучения алгоритмов: без них модель видит преимущественно результат уже состоявшегося отбора.

Но последовательность экспериментального антитела может представлять коммерчески чувствительную интеллектуальную собственность. Передать конкурентам такую базу практически невозможно.

Apheris предлагает обойти это ограничение с помощью федеративной вычислительной инфраструктуры.

Принцип состоит в разделении данных и вычислений. Вместо того чтобы собирать всю закрытую информацию компаний в одной доступной участникам базе, вычислительные процедуры и модели работают в защищённой инфраструктуре, а проприетарные последовательности не раскрываются другим участникам.

Компании сохраняют права на предоставленные ими последовательности и экспериментальные данные. Полученную базовую модель можно затем переносить в собственную среду участника и дополнительно настраивать на его внутренних молекулах.

Поэтому ценность проекта заключается не только в размере датасета. Консорциум проверяет более широкую модель сотрудничества: могут ли конкурирующие фармацевтические компании совместно улучшать ИИ, не создавая общей открытой базы своей интеллектуальной собственности.

AbbVie, argenx, Lundbeck и Takeda получают то, чего трудно добиться поодиночке

В число основателей вошли четыре компании с разными портфелями и исследовательскими стратегиями — AbbVie, argenx, Lundbeck и Takeda.

Для модели это важно не только количественно. Даже крупная фармацевтическая компания располагает прежде всего молекулами, возникшими из её собственных исследовательских платформ, мишеней и методов отбора. Такая база может быть большой, но охватывать ограниченную часть возможного пространства последовательностей антител.

Объединение разнообразных портфелей потенциально расширяет это пространство.

В AbbVie прямо связывают инициативу с ограничениями так называемых «удобных» наборов данных — информации, которая доступна исследователям не потому, что оптимально подходит для обучения модели, а потому, что её удалось получить.

Lundbeck отдельно указывает на значение разрабатываемости для сложных терапевтических направлений, включая заболевания центральной нервной системы. Takeda делает акцент на том, что более крупные стандартизированные массивы могут повысить качество прогнозных моделей и ускорить выбор перспективных кандидатов.

Независимый научный надзор за проектом осуществляют профессор структурной биоинформатики Оксфордского университета Шарлотта Дин и профессор фармацевтических наук и химической инженерии Мичиганского университета Питер Тессье.

Главный результат станет понятен не по размеру базы, а по новым молекулам

Консорциум пока не доказал, что его подход позволит надёжно предсказывать разрабатываемость антител.

Цель в 10 000 молекул значительно превышает размеры многих существующих стандартизированных наборов, но больше данных автоматически не означают хороший прогноз. Результат зависит от разнообразия последовательностей, качества измерений, выбора характеристик, устройства обучающей выборки и способности моделей работать за пределами знакомого им молекулярного пространства.

Кроме того, разрабатываемость — не единое свойство. Стабильность, растворимость, агрегация, экспрессия и неспецифические взаимодействия возникают из разных физических механизмов. Поэтому вполне возможно, что одни характеристики станут предсказываться значительно лучше других.

Настоящим испытанием будет не способность модели воспроизвести закономерности внутри консорциумного набора, а её работа на новых проприетарных молекулах отдельных компаний.

Именно предыдущий слепой эксперимент Ginkgo показал, почему такая проверка необходима.

Если прогноз станет надёжнее, изменится самый ранний этап разработки антител

Практическое значение проекта находится далеко до клинических исследований и пациента — на этапе выбора молекулы, которую вообще стоит превращать в лекарство.

Сегодня исследовательская группа может иметь множество антител с подходящей биологической активностью. Если модель сможет заранее достаточно надёжно выделять среди них кандидатов с меньшим риском агрегации, нестабильности, плохой экспрессии или других проблем, лабораторные ресурсы можно будет концентрировать на более перспективных вариантах.

Это не отменит экспериментальные исследования. Скорее ИИ может изменить последовательность отбора: лаборатория будет подробно проверять меньше кандидатов, выбранных на основании более информативного предварительного прогноза.

Для фармацевтических компаний потенциальный эффект состоит в снижении числа дорогостоящих тупиков на ранних стадиях. Для разработчиков биологических препаратов — в возможности учитывать будущие производственные свойства молекулы одновременно с её биологической активностью, а не решать проблемы последовательно.

Ограничивающим ресурсом в биофармацевтическом ИИ всё чаще становится не архитектура очередной модели, а качественные экспериментальные данные, на которых она учится.

Для пациентов возможный эффект значительно более отдалённый: если неудачные кандидаты будут отсеиваться раньше, ресурсы разработки смогут быстрее переходить к молекулам с более реалистичной перспективой стать лекарствами. Но пока это именно потенциальное следствие, а не продемонстрированное ускорение появления новых препаратов.

Первый набор данных консорциум рассчитывает предоставить участникам в начале 2027 года. В дальнейшем проект планируется расширить на более сложные форматы антител, что особенно важно на фоне роста числа биспецифических и других инженерных биологических препаратов.

Синтез от АПТЕКИУМ: Antibody Developability Consortium показывает важный сдвиг в биофармацевтическом ИИ: ограничивающим ресурсом всё чаще становится не архитектура очередной модели, а качественные экспериментальные данные, на которых она учится. Если федеративная схема позволит конкурентам извлекать общую прогностическую ценность из закрытых корпоративных данных, не раскрывая интеллектуальную собственность, значение проекта выйдет далеко за пределы разработки антител. Он может стать примером того, как фармацевтическая отрасль будет решать одну из фундаментальных проблем медицинского ИИ — знания распределены между компаниями, а модели становятся действительно полезными только тогда, когда способны учиться на гораздо более широком опыте, чем доступен каждой из них по отдельности.
18+
Для профессионального сообщества:

Данная публикация предназначена для специалистов здравоохранения и участников фармрынка. Аналитические выводы редакции носят информационный характер и не являются призывом к самолечению или заменой очной консультации врача. При работе с лекарственными препаратами необходимо руководствоваться официальной инструкцией и мнением профильного специалиста. Полный текст дисклеймера.