Журнал · Rit.work

Сильному агенту машинного обучения не понадобилась сложная обвязка

Минимальный агент Malena сравнялся со специализированными системами на MLE-bench и NatureBench, если модель, оборудование и время работы совпадали.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Сложная программная обвязка не улучшила работу сильного автономного агента в задачах машинного обучения. За одинаковые 24 часа минимальный Malena не уступил четырём специализированным системам с открытым кодом, хотя препринт не рецензирован и все числа получили сами авторы. Значит, разработку такого агента можно начинать с прямого доступа модели к рабочей среде, а не с дерева поиска и команды подагентов.

Malena состоит из одной продолжительной сессии: модель читает и меняет файлы, запускает код, проверяет результат и сама выбирает следующий эксперимент. Обвязка лишь сообщает доступные ресурсы и оставшееся время, помогает вести фоновые задачи и сохраняет готовые решения. Авторы сравнили этот вариант с пошаговым улучшением решений, независимыми запусками, несколькими стратегиями поиска и оркестрацией нескольких агентов.

Самый заметный прирост дал переход от обычного текстового ответа к среде, где модель может исполнять и отлаживать код. После этого ни стратегия поиска, ни делегирование подагентам, ни параллельная работа не дали статистически значимого преимущества. В одном из срезов обмен сообщениями между параллельными агентами совпал с падением доли запусков, достигших порога медали MLE-bench, с 56% до 33%.

Основные эксперименты с отдельными компонентами провели на 29 задачах MLE-bench, чаще всего с GLM 5.2. Для каждого сравнения сохраняли одну базовую модель, одинаковое оборудование и лимит времени. Затем Malena сопоставили со специализированными системами на MLE-bench и NatureBench при нескольких базовых моделях; простая схема в этих условиях либо совпадала с ними, либо работала лучше.

Вывод относится к текущим наборам задач автономной разработки моделей, где агент получает данные, код и вычислительную среду. Для продуктовой команды это меняет порядок вложений: сначала стоит проверить одну хорошо настроенную сессию сильной модели, а оркестрацию добавлять только после измеримого выигрыша на собственных задачах.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу