Журнал · Rit.work

Формат ответа может скрыть результат дообучения LLM

Авторы показали, что схема ответа влияет и на градиентные метрики качества данных, и на точность дообученной модели на бенчмарке.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Chengguang Gan и соавторы исследовали, как форма ответа влияет на оценку данных и результатов дообучения LLM; работа опубликована как препринт, который не проходил рецензирование. По их замерам, обучение навыку в одном формате повышало точность более чем на 40 процентных пунктов в том же формате, но почти не давало прироста в остальных. Это важно командам, которые отбирают данные по градиентным метрикам или сравнивают дообученные модели на бенчмарках.

Что сделали

Авторы представили одинаковые по смыслу ответы в нескольких интерфейсах: как обычный текст, отдельный фрагмент, поле JSON и размеченный тегом ответ. Для каждого варианта они получили направление градиента обновления низкорангового адаптера — малого подключаемого набора обучаемых параметров. Затем исследователи разделили общую для форматов составляющую и остаток, зависящий от сочетания задачи и интерфейса.

Скалярные метрики на основе спектра градиента, включая эффективный ранг, не отличали чистые данные от семантически испорченных лучше установленного авторами диапазона случайного различения. Направление обновления сохраняло полезный сигнал: остаток правильно связывал каждый чистый пример с его целевой задачей во всех проверенных семействах моделей.

При дообучении проявилась привязка навыка к интерфейсу. Модель могла показать прирост только при той же схеме ответа, на которой обучалась. Отдельно авторы обнаружили, что исправление лимита генерации на GSM8K меняло знак измеренного эффекта дообучения: прежний прирост превращался в падение.

Что это значит

Формат ответа следует считать частью протокола оценки, а не нейтральной упаковкой. Для сравнения моделей нужно выравнивать схему ответа, разбор результата, условие остановки и лимит генерации. При отборе данных недостаточно одной спектральной характеристики градиента: метрику стоит проверять на семантических искажениях в нескольких форматах.

Ограничения. Авторы проверяли подход на 12 задачах, четырёх основных интерфейсах и трёх семействах моделей размером менее 10 млрд параметров. Работа сосредоточена на классификации, коротких рассуждениях и низкоранговых адаптерах; длинные ответы и полное дообучение не исследовались. Набор искусственных и естественных искажений не покрывает все дефекты рабочих данных, а испытанная авторами геометрическая коррекция не устранила привязку навыка к формату. Сравнения с более крупными моделями и другими способами дообучения в работе нет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу