Журнал · Rit.work

LabAgent сохраняет методы лаборатории как проверяемые навыки ИИ-агента

LabAgent собирает исполняемые навыки из кода и публикаций лаборатории, сверяет результат с исходной работой и сохраняет найденные исправления для следующих запусков.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

ИИ-агент смог сохранять рабочие приёмы исследовательской группы, воспроизводить её расчёты и применять проверенные процедуры к новым задачам. В препринте команды из Yale, Stanford и других организаций, который не рецензировали и где все числа получили сами авторы, LabAgent попал в опубликованный диапазон результатов для 32 из 65 задач по свойствам лекарств. Для продуктовых команд работа предлагает архитектуру, в которой ценность создаёт не только базовая модель, но и накопленная библиотека исполняемых методов.

LabAgent строит отдельный набор знаний для конкретной лаборатории. Агент изучает статьи, репозитории, руководства и обсуждения ошибок, а затем связывает описание метода с кодом, который его реализует.

Результатом становится исполняемый навык: инструкция содержит подготовку данных, зависимости, параметры, команды запуска и известные причины сбоев. Это отличает подход от обычной базы документов, где агент может найти объяснение метода, но не получает подтверждения, что собранная процедура действительно работает.

Черновик навыка дополнительно проверяет модель-оценщик по заданным критериям. В библиотеку он попадает только после сквозного выполнения. Успешное завершение программы при этом не считается достаточным: результат должен совпасть с опубликованной метрикой в пределах указанного авторами разброса.

Такой порог меняет смысл проверки. Контур отделяет технически исправный запуск от научного воспроизведения: код может не упасть, но дать другое качество из-за версии пакета, пропущенной обработки данных или неверного параметра.

Ошибки превращаются в память для следующего воспроизведения

После создания навыка второй агент получает целевой результат, подбирает подходящую процедуру и проводит её через шесть специализированных ролей — от проверки среды до разбора неудачного результата. Вместе с итоговой метрикой он сохраняет сценарии, конфигурации и журналы выполнения.

Если запуск ломается, LabAgent связывает ошибку с конкретным шагом навыка, исправляет процедуру и повторяет попытку. Команда, которая решила конфликт версий или нашла правильную последовательность установки зависимостей, остаётся в постоянной памяти и доступна следующим задачам.

В одном из показанных запусков агент восстанавливал MiniMol и последовательно столкнулся с недоступными пакетами, конфликтами версий и ошибкой общей библиотеки. После исправлений он получил значение метрики 0,455 при опубликованном результате 0,474 с допустимым отклонением 0,025. Эта трасса показывает, зачем системе нужна память: существенная часть работы находится между найденным репозиторием и воспроизводимым числом.

На задачах по свойствам лекарств LabAgent оказался точнее двух коммерческих контуров, но стоил дороже — в среднем 4,56 доллара за задачу. В открытом анализе биомедицинских данных он набрал 74,4 балла по экспертным критериям и опередил ближайший вариант на 2,1 балла. Разрыв зависит от типа анализа: системы менялись местами на отдельных задачах.

Архитектура полезнее как шаблон, чем как готовая замена исследователю

Работу проверяли в четырёх направлениях наук о жизни: прогнозировании свойств лекарств, анализе биомедицинских данных, оценке вариантов белков и статистической генетике. Эксперименты охватили три бенчмарка и два прикладных примера — от восстановления рейтингов моделей до повторения опубликованной фигуры без готового кода для неё.

Каждую цель агент запускал один раз, поэтому результаты не показывают, насколько стабильно весь контур повторяет собственный успех. Сравнение с Claude Code и Codex также оценивает системы целиком: у них различаются инструменты, устройство контура, а в одном случае и базовая модель. По этим замерам нельзя приписать весь разрыв библиотеке навыков.

Для команд, которые автоматизируют сложные вычислительные процессы, практический вывод уже применим. Процедуру стоит хранить не как текстовую подсказку, а как версионируемый исполняемый объект с условиями запуска, контрольной метрикой и историей исправлений. Проверка должна сравнивать итог с известным эталоном, а не ограничиваться кодом возврата программы.

Это не требует сразу строить универсального научного агента. Начать можно с узкого семейства повторяющихся расчётов, для которых существуют исходный код и проверяемый результат. Если накопленные исправления сокращают повторную настройку среды, библиотека навыков становится самостоятельным активом команды; если нет, дополнительный агентный контур лишь увеличивает стоимость запуска.

LabAgent пока не доказывает, что такой подход надёжно переносится за пределы выбранных биомедицинских задач. Но работа сдвигает полезный объект проектирования: вместо выбора одной LLM команда проектирует систему, которая исполняет методы, проверяет результат и не забывает найденные исправления.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу