Журнал · Rit.work

RankEvolve превращает автоисследование моделей в управляемый процесс

RankEvolve показывает, как соединить исполняемый протокол, взаимную проверку Claude Code и Codex и память экспериментов в одном контуре разработки моделей.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Автоматический контур для экспериментов с моделями ранжирования научился дольше работать без тихих ошибок в коде и оценке результатов. В препринте Meta, который не проходил рецензирование и где числа получили сами авторы, сочетание Claude Code и Codex повысило точность исполнения на 16,7 процентного пункта. Для команд, которые автоматизируют исследования моделей, работа смещает акцент с выбора одного агента на управление всем процессом.

Протокол управляет процессом, а не рассуждениями агента

RankEvolve автоматизирует цикл прикладного машинного обучения: изучает код и предыдущие работы, предлагает гипотезы, вносит изменения, запускает обучение, проверяет метрики и выбирает следующий эксперимент. Один неверный шаг в таком цикле может незаметно подключить тестовые данные к обучению, разорвать градиент или оставить неработающий флаг режима.

Чтобы ошибки не накапливались, процедура хранится как версионируемый полуструктурированный документ. В нём описаны этапы, зависимости, развилки, циклы, разрешённые инструменты и точки, где решение принимает человек. Документ компилируется в конечный автомат: среда исполнения сама переключает состояния, не позволяет пропустить обязательный этап и останавливает ветку при исчерпании бюджета.

Агент получает общие правила и инструкцию только для текущего шага, а не весь регламент целиком. Это уменьшает контекст и не даёт старым указаниям вытеснять текущую задачу. При этом среда контролирует порядок действий, но не гарантирует, что гипотеза разумна или код семантически верен.

После каждого узла RankEvolve сохраняет состояние, патч, конфигурацию обучения, результаты тестов, происхождение метрики и решение о дальнейшем использовании изменения. Неудачные эксперименты остаются в общей базе наравне с успешными, поэтому следующие итерации могут учитывать уже проверенные тупики. Отдельного сравнения с отключённой памятью в работе нет, поэтому её собственный вклад не отделён от остальных частей системы.

Разные агенты исправляют разные классы ошибок

Claude Code, Codex и OpenHands подключаются не как отдельные вызовы моделей, а как готовые продукты со своими планировщиками, инструментами и управлением контекстом. Единый адаптер передаёт каждому задачу, снимок репозитория, разрешённые инструменты и бюджет, а получает патч, журнал действий и сведения о расходе ресурсов.

Основной сценарий строится как взаимная проверка: один продукт предлагает или реализует изменение, другой изучает результат, после чего первый исправляет замечания. Цикл ограничен числом попыток, а при сбое узел закрывается с ошибкой вместо того, чтобы пропустить сомнительный результат дальше.

Точность исполнения измеряли на ExecML-HSTU — наборе задач с закрытыми проверками и эталонными исправлениями, который собрали из реальных происшествий во время разработки. Полностью правильным считался только патч, прошедший все проверки, включая смысловые условия, которые обычная непрерывная интеграция могла не заметить. Доля тихих критических дефектов у составного контура составила 10,4%.

Эффект повторился на задачах из LitGPT: разнородная пара прибавила 12,5 процентного пункта при сопоставимом бюджете. Разница между конкретными схемами взаимодействия оказалась в пределах погрешности — результат дал прежде всего выбор двух продуктов с разными ошибками, а не особая форма графа.

Контур также провели через 12 итераций на открытом рекомендателе HSTU и MovieLens-20M. Лучший вариант для крупной конфигурации улучшил NDCG@10 — качество ранжирования первых десяти рекомендаций — на 4,48% относительно опубликованной исходной точки. Этот прогон включал человеческие точки контроля, поэтому он подтверждает работоспособность процесса целиком, но не отделяет вклад оператора.

Командам стоит менять архитектуру контура, а не выбирать нового победителя

Практический шаблон из работы состоит из трёх независимых слоёв. Первый хранит исполняемый регламент и состояние процесса. Второй подключает продукты через одинаковые адаптеры и организует проверку с исправлением. Третий сохраняет артефакты, отрицательные результаты и связь каждого вывода с конкретным запуском.

Такая схема меняет планы команды, если неверный эксперимент расходует заметное время GPU или влияет на следующие итерации. В этом случае журнал событий, закрытые проверки, контроль бюджета и восстановление с последней подтверждённой границы нужны раньше, чем автономный выбор новых гипотез. Второй агент имеет смысл добавлять после проверки, что его ошибки действительно отличаются от ошибок первого: при совпадающих сбоях составной контур только увеличит расходы.

Работа не даёт оснований полностью убирать человека. В HSTU оператор утверждал предложения и вычислительный бюджет, останавливал слишком дорогой эксперимент и задавал правила сравнения. Автоматизация здесь сокращает ручное сопровождение длинного цикла, но стратегические решения и допуск затрат остаются отдельными воротами.

Проверка охватывает один рекомендательный код и LitGPT; оба проекта написаны на Python и PyTorch. У коммерческих агентов сравнивали видимый расход токенов, действия, время и стоимость, но не внутренние вычисления поставщиков. Поэтому RankEvolve стоит воспринимать как проверенный шаблон для контуров машинного обучения, а не как доказательство надёжности в любом длительном процессе.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу