Журнал · Rit.work

Модель-оценщик ошибается по-разному на версиях одного агента

Фиксированная модель-оценщик может принять несуществующее улучшение агента, поэтому выпуск новой версии стоит подтверждать на парных актуальных ответах.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одна и та же модель-оценщик, которая сравнивает ответы ИИ-агентов, по-разному ошибается на старой и новой версиях. В работе Jiapeng Li перенос калибровки — поправки по прежним ошибкам — увеличил ошибку сравнения с 3,8 до 19,5 пункта; препринт не рецензирован, а числа получил сам автор. Значит, решение о выпуске обновления нельзя строить только на таком вердикте: его следует подтверждать парным аудитом актуальных ответов.

Для каждой пары версий вердикты фиксированной модели сопоставили с результатами выполнения задач. Проверка учитывала конкретную задачу и фактический исход, чтобы отделить обычный шум от ошибки, связанной именно с версией агента. Ошибки зависели от версии во всех проверенных группах моделей-оценщиков.

На SWE-bench Verified в восьми случаях оценщик объявил улучшение, которого результаты запуска подтвердить не смогли. На tau-bench один оценщик развернул разрыв в 9 пунктов в пользу противоположного агента: он штрафовал за процедурную привычку, которую эталонная функция награды не учитывала. Более способные агенты также чаще получали ложное одобрение для неработающих исправлений при одинаковых задаче и исходе.

Практическая замена — парный аудит: размечать ответы обеих версий на одних и тех же актуальных задачах. Он нужен перед выпуском, если преимущество невелико или модель-оценщик настроена по результатам прежней версии. Старую калибровку нельзя автоматически переносить на обновлённого агента, даже когда общий порядок моделей выглядит правдоподобно.

Проверка охватила 250 задач SWE-bench Verified, 155 задач tau-bench и 1 106 размеченных экспертами траекторий AgentRewardBench; повтор с OpenHands использовал те же задачи, а не новый набор. Поскольку полный текст получить не удалось и заметка сделана по абстракту, детали процедуры сравнения здесь не восстанавливаются.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу