Журнал · Rit.work

Метрика выросла, а релиз не состоялся

Новый бенчмарк проверяет, способен ли LLM-агент не только обучить модель, но и выпустить её с корректными артефактами, расходами и приёмочной проверкой.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM-агент может улучшить целевую метрику и всё же не довести постобученную модель до пригодного релиза. В препринте Weihang Ding и Junfei Zhan, который не прошёл рецензирование и основан на замерах самих авторов, контракт поставки отклонил 31 из 38 результатов с успешно пройденной оценкой. Поэтому приёмку и оплату стоит связывать не с графиком потерь, а с проверкой модели и всех релизных артефактов.

Авторы построили контур из десяти этапов: от разбора заявки и выбора способа обучения до развёртывания, сверки расходов и передачи результата. LLM-агент принимает решения, платформа исполняет их, а независимый проверяющий контур оценивает факты из журналов и артефактов, не полагаясь на отчёт самого агента.

Главный риск — запуск, который технически завершается, но не учит модель решать задачу заказчика. Потери снижаются, проверки обучения остаются зелёными, GPU оплачены, однако результат не превосходит базовую модель. Это выявляет приёмочная проверка на скрытом от агента наборе данных, которую запускают после передачи результата и до оплаты.

Правильная конфигурация сама по себе проблему не решила. После того как агентам выдали эталонные настройки, все 24 запуска прошли проверку качества модели, но 22 результата всё равно отклонили: не сошлись отчёты о расходах, карточки моделей не прошли проверку схемы или автоматические проверки реестра нашли ошибки. Значит, узкое место смещается от настройки обучения к соблюдению контракта поставки.

Проверяли Claude Opus 5, GPT-5.6-luna, Gemini 3.7 Flash и DeepSeek V4-Pro на пяти задачах контролируемого дообучения: классификации обращений, поддержке, вызове функций, финансовых вопросах и юридических документах. Агенты работали с открытыми моделями от 8B до 70B параметров на L40S, A100 и H200; все запуски были одноузловыми. Сценарий обучения по предпочтениям исключили, поскольку его эталонный запуск не показал требуемого улучшения.

Практическая схема следует из самого теста: внешний сервис одобрения выдаёт одноразовое разрешение, привязанное к модели и результатам оценки, а API развёртывания отвергает релиз без него. Такой барьер проверяет поставку независимо от того, работает автономный агент или инженер с помощником.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу