Журнал · Rit.work

В агентной разработке лекарств узким местом оказался оценщик молекул

MAGI сравнил LLM и REINVENT 4 на промышленных кампаниях: выбор генератора влиял на широту поиска, но достижение цели определяла точность моделей оценки.

Rit.work
Студия разработки
7 октября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В агентной разработке лекарственных молекул результат ограничила не координация инструментов, а точность моделей, которые оценивают кандидатов. MAGI не получил устойчивого преимущества ни от прямой генерации LLM, ни от REINVENT 4 на девяти прошлых промышленных кампаниях, хотя работа не рецензирована и все числа получили сами авторы. Командам имеет смысл переносить главный контроль с выбора генератора на проверку области применимости оценщика.

Как MAGI отделил генерацию молекул от их оценки

MAGI управляет циклом оптимизации: формулирует цели проекта, запускает инструменты, следит за ходом расчётов, анализирует связь между структурой молекулы и её свойствами и меняет стратегию. В работе использовали Claude Sonnet 4.6, который мог предложить молекулы сам или передать генерацию REINVENT 4.

REINVENT 4 ищет структуры, которые максимизируют заданную функцию оценки. Сам он не решает, какие свойства важны для проекта и когда нужно пересмотреть цель. MAGI добавляет этот управляющий слой: хранит машиночитаемый профиль требований, превращает его в исполняемую конфигурацию и фиксирует каждую версию.

Оба маршрута обращались к одним и тем же сервисам через общий контракт. Оценщики предсказывали активность, растворимость и другие свойства, а структурные инструменты проверяли предполагаемое взаимодействие молекулы с белком. Благодаря этому результат генераторов можно было сравнить отдельно от качества моделей оценки.

Проверка охватила прошлые проекты GSK, Sanofi и AstraZeneca. Для каждой кампании агент видел исходную молекулу и четыре измеренных аналога, а остальные соединения оставались скрытыми. Кампанию воспроизводили с временной отсечкой: модели Sanofi обучались только на данных, доступных до выбранного момента, после чего MAGI проводил пять циклов генерации, оценки и отбора.

Это ретроспективный расчёт, а не лабораторный эксперимент. Свойства предложенных молекул предсказывали модели; реальные измерения скрытых соединений служили ориентиром для сравнения.

Широта поиска не исправила ошибки оценщика

Оба маршрута выдавали корректные химические структуры, но исследовали пространство по-разному. LLM оставался ближе к показанным аналогам и работал как локальный оптимизатор. REINVENT 4 предлагал более разнообразные молекулы и дальше отходил от исходного химического ряда.

Широкий поиск не дал устойчивого выигрыша по целям проекта. Три из четырёх кампаний GSK и кампания AstraZeneca достигли заданного порога. Среди проектов Sanofi его прошли FXA и PPARδ, тогда как MMP8 и RENIN остановились ниже цели.

Неудачи совпали со слабостями оценщиков. В GSK-S1 требуемая растворимость лежала за пределами значений, на которых обучалась модель, поэтому она экстраполировала в незнакомую область. Для RENIN модель плохо ранжировала скрытые экспериментальные соединения. Ни более разнообразная генерация, ни дополнительная координация не могли надёжно исправить неверный сигнал.

Цена широкого поиска проявилась в вычислительной работе. Маршрут с REINVENT 4 потребовал в четыре-девять раз больше видимых агенту операций и перебирал более чем на 100 000 структур за кампанию больше, чем LLM. При этом прямой маршрут чаще достигал цели, хотя исследовал более узкую область.

В слепой оценке химики не смогли надёжно отличить предложения агента от скрытых проектных соединений и не предпочли один маршрут другому. Объяснения связи между структурой и активностью они сочли в целом правдоподобными, но неполными.

Планы стоит менять вокруг контроля оценщиков

Работа не показывает, что для агентной разработки лекарств нужен один универсальный генератор. Выбор зависит от режима поиска: LLM подходит для осторожного движения вокруг известного химического ряда, а REINVENT 4 — для расширения пространства кандидатов. Их можно держать за общим интерфейсом и переключать без перестройки остальной системы.

Главный инженерный риск находится дальше по цепочке. Если оценщик обучался на похожей химии и правильно ранжирует соединения, агент может использовать его сигнал. Если новые структуры выходят за область применимости, оптимизация начинает усиливать ошибку модели: лучший балл уже не означает лучший кандидат.

Поэтому в план такой системы стоит включать проверку оценщика на временно отложенных проектных данных, контроль диапазона его обучения и наблюдение за тем, сохраняет ли он правильный порядок кандидатов. Полезно также записывать версии целей и моделей: иначе нельзя установить, почему агент изменил направление и какой оценщик привёл к выбранной молекуле.

Вывод о роли самого агента пока уже, чем вывод о роли оценщиков. Для каждого условия использовали один языковой сервер и одну траекторию, а отдельного варианта с неизменной целью не было. Поэтому эксперимент не изолирует вклад адаптации MAGI; временное разделение данных также не исключает, что часть проектной химии могла попасть в предварительное обучение LLM.

MAGI разумнее рассматривать как слой координации и подготовки списка кандидатов, а не как замену экспериментальной проверке. Такая архитектура сокращает ручную работу и позволяет менять инструменты, но её верхняя граница определяется тем, насколько хорошо оценочные модели представляют именно ту химию, которую начинает предлагать агент.

Источники

Иллюстрация: рисунок из статьи «From Benchmark to Bench: Can Agents Survive Real-World Drug Discovery?», Pierre Llompart, Levent Guner, Helen Lai и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу