Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
В агентной разработке лекарственных молекул результат ограничила не координация инструментов, а точность моделей, которые оценивают кандидатов. MAGI не получил устойчивого преимущества ни от прямой генерации LLM, ни от REINVENT 4 на девяти прошлых промышленных кампаниях, хотя работа не рецензирована и все числа получили сами авторы. Командам имеет смысл переносить главный контроль с выбора генератора на проверку области применимости оценщика.
Как MAGI отделил генерацию молекул от их оценки
MAGI управляет циклом оптимизации: формулирует цели проекта, запускает инструменты, следит за ходом расчётов, анализирует связь между структурой молекулы и её свойствами и меняет стратегию. В работе использовали Claude Sonnet 4.6, который мог предложить молекулы сам или передать генерацию REINVENT 4.
REINVENT 4 ищет структуры, которые максимизируют заданную функцию оценки. Сам он не решает, какие свойства важны для проекта и когда нужно пересмотреть цель. MAGI добавляет этот управляющий слой: хранит машиночитаемый профиль требований, превращает его в исполняемую конфигурацию и фиксирует каждую версию.
Оба маршрута обращались к одним и тем же сервисам через общий контракт. Оценщики предсказывали активность, растворимость и другие свойства, а структурные инструменты проверяли предполагаемое взаимодействие молекулы с белком. Благодаря этому результат генераторов можно было сравнить отдельно от качества моделей оценки.
Проверка охватила прошлые проекты GSK, Sanofi и AstraZeneca. Для каждой кампании агент видел исходную молекулу и четыре измеренных аналога, а остальные соединения оставались скрытыми. Кампанию воспроизводили с временной отсечкой: модели Sanofi обучались только на данных, доступных до выбранного момента, после чего MAGI проводил пять циклов генерации, оценки и отбора.
Это ретроспективный расчёт, а не лабораторный эксперимент. Свойства предложенных молекул предсказывали модели; реальные измерения скрытых соединений служили ориентиром для сравнения.
Широта поиска не исправила ошибки оценщика
Оба маршрута выдавали корректные химические структуры, но исследовали пространство по-разному. LLM оставался ближе к показанным аналогам и работал как локальный оптимизатор. REINVENT 4 предлагал более разнообразные молекулы и дальше отходил от исходного химического ряда.
Широкий поиск не дал устойчивого выигрыша по целям проекта. Три из четырёх кампаний GSK и кампания AstraZeneca достигли заданного порога. Среди проектов Sanofi его прошли FXA и PPARδ, тогда как MMP8 и RENIN остановились ниже цели.
Неудачи совпали со слабостями оценщиков. В GSK-S1 требуемая растворимость лежала за пределами значений, на которых обучалась модель, поэтому она экстраполировала в незнакомую область. Для RENIN модель плохо ранжировала скрытые экспериментальные соединения. Ни более разнообразная генерация, ни дополнительная координация не могли надёжно исправить неверный сигнал.
Цена широкого поиска проявилась в вычислительной работе. Маршрут с REINVENT 4 потребовал в четыре-девять раз больше видимых агенту операций и перебирал более чем на 100 000 структур за кампанию больше, чем LLM. При этом прямой маршрут чаще достигал цели, хотя исследовал более узкую область.
В слепой оценке химики не смогли надёжно отличить предложения агента от скрытых проектных соединений и не предпочли один маршрут другому. Объяснения связи между структурой и активностью они сочли в целом правдоподобными, но неполными.
Планы стоит менять вокруг контроля оценщиков
Работа не показывает, что для агентной разработки лекарств нужен один универсальный генератор. Выбор зависит от режима поиска: LLM подходит для осторожного движения вокруг известного химического ряда, а REINVENT 4 — для расширения пространства кандидатов. Их можно держать за общим интерфейсом и переключать без перестройки остальной системы.
Главный инженерный риск находится дальше по цепочке. Если оценщик обучался на похожей химии и правильно ранжирует соединения, агент может использовать его сигнал. Если новые структуры выходят за область применимости, оптимизация начинает усиливать ошибку модели: лучший балл уже не означает лучший кандидат.
Поэтому в план такой системы стоит включать проверку оценщика на временно отложенных проектных данных, контроль диапазона его обучения и наблюдение за тем, сохраняет ли он правильный порядок кандидатов. Полезно также записывать версии целей и моделей: иначе нельзя установить, почему агент изменил направление и какой оценщик привёл к выбранной молекуле.
Вывод о роли самого агента пока уже, чем вывод о роли оценщиков. Для каждого условия использовали один языковой сервер и одну траекторию, а отдельного варианта с неизменной целью не было. Поэтому эксперимент не изолирует вклад адаптации MAGI; временное разделение данных также не исключает, что часть проектной химии могла попасть в предварительное обучение LLM.
MAGI разумнее рассматривать как слой координации и подготовки списка кандидатов, а не как замену экспериментальной проверке. Такая архитектура сокращает ручную работу и позволяет менять инструменты, но её верхняя граница определяется тем, насколько хорошо оценочные модели представляют именно ту химию, которую начинает предлагать агент.
Источники
Иллюстрация: рисунок из статьи «From Benchmark to Bench: Can Agents Survive Real-World Drug Discovery?», Pierre Llompart, Levent Guner, Helen Lai и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



