Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
ИИ-агент смог сохранять рабочие приёмы исследовательской группы, воспроизводить её расчёты и применять проверенные процедуры к новым задачам. В препринте команды из Yale, Stanford и других организаций, который не рецензировали и где все числа получили сами авторы, LabAgent попал в опубликованный диапазон результатов для 32 из 65 задач по свойствам лекарств. Для продуктовых команд работа предлагает архитектуру, в которой ценность создаёт не только базовая модель, но и накопленная библиотека исполняемых методов.
Навык принимают в библиотеку только после рабочего запуска
LabAgent строит отдельный набор знаний для конкретной лаборатории. Агент изучает статьи, репозитории, руководства и обсуждения ошибок, а затем связывает описание метода с кодом, который его реализует.
Результатом становится исполняемый навык: инструкция содержит подготовку данных, зависимости, параметры, команды запуска и известные причины сбоев. Это отличает подход от обычной базы документов, где агент может найти объяснение метода, но не получает подтверждения, что собранная процедура действительно работает.
Черновик навыка дополнительно проверяет модель-оценщик по заданным критериям. В библиотеку он попадает только после сквозного выполнения. Успешное завершение программы при этом не считается достаточным: результат должен совпасть с опубликованной метрикой в пределах указанного авторами разброса.
Такой порог меняет смысл проверки. Контур отделяет технически исправный запуск от научного воспроизведения: код может не упасть, но дать другое качество из-за версии пакета, пропущенной обработки данных или неверного параметра.
Ошибки превращаются в память для следующего воспроизведения
После создания навыка второй агент получает целевой результат, подбирает подходящую процедуру и проводит её через шесть специализированных ролей — от проверки среды до разбора неудачного результата. Вместе с итоговой метрикой он сохраняет сценарии, конфигурации и журналы выполнения.
Если запуск ломается, LabAgent связывает ошибку с конкретным шагом навыка, исправляет процедуру и повторяет попытку. Команда, которая решила конфликт версий или нашла правильную последовательность установки зависимостей, остаётся в постоянной памяти и доступна следующим задачам.
В одном из показанных запусков агент восстанавливал MiniMol и последовательно столкнулся с недоступными пакетами, конфликтами версий и ошибкой общей библиотеки. После исправлений он получил значение метрики 0,455 при опубликованном результате 0,474 с допустимым отклонением 0,025. Эта трасса показывает, зачем системе нужна память: существенная часть работы находится между найденным репозиторием и воспроизводимым числом.
На задачах по свойствам лекарств LabAgent оказался точнее двух коммерческих контуров, но стоил дороже — в среднем 4,56 доллара за задачу. В открытом анализе биомедицинских данных он набрал 74,4 балла по экспертным критериям и опередил ближайший вариант на 2,1 балла. Разрыв зависит от типа анализа: системы менялись местами на отдельных задачах.
Архитектура полезнее как шаблон, чем как готовая замена исследователю
Работу проверяли в четырёх направлениях наук о жизни: прогнозировании свойств лекарств, анализе биомедицинских данных, оценке вариантов белков и статистической генетике. Эксперименты охватили три бенчмарка и два прикладных примера — от восстановления рейтингов моделей до повторения опубликованной фигуры без готового кода для неё.
Каждую цель агент запускал один раз, поэтому результаты не показывают, насколько стабильно весь контур повторяет собственный успех. Сравнение с Claude Code и Codex также оценивает системы целиком: у них различаются инструменты, устройство контура, а в одном случае и базовая модель. По этим замерам нельзя приписать весь разрыв библиотеке навыков.
Для команд, которые автоматизируют сложные вычислительные процессы, практический вывод уже применим. Процедуру стоит хранить не как текстовую подсказку, а как версионируемый исполняемый объект с условиями запуска, контрольной метрикой и историей исправлений. Проверка должна сравнивать итог с известным эталоном, а не ограничиваться кодом возврата программы.
Это не требует сразу строить универсального научного агента. Начать можно с узкого семейства повторяющихся расчётов, для которых существуют исходный код и проверяемый результат. Если накопленные исправления сокращают повторную настройку среды, библиотека навыков становится самостоятельным активом команды; если нет, дополнительный агентный контур лишь увеличивает стоимость запуска.
LabAgent пока не доказывает, что такой подход надёжно переносится за пределы выбранных биомедицинских задач. Но работа сдвигает полезный объект проектирования: вместо выбора одной LLM команда проектирует систему, которая исполняет методы, проверяет результат и не забывает найденные исправления.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



