Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Chengguang Gan и соавторы исследовали, как форма ответа влияет на оценку данных и результатов дообучения LLM; работа опубликована как препринт, который не проходил рецензирование. По их замерам, обучение навыку в одном формате повышало точность более чем на 40 процентных пунктов в том же формате, но почти не давало прироста в остальных. Это важно командам, которые отбирают данные по градиентным метрикам или сравнивают дообученные модели на бенчмарках.
Что сделали
Авторы представили одинаковые по смыслу ответы в нескольких интерфейсах: как обычный текст, отдельный фрагмент, поле JSON и размеченный тегом ответ. Для каждого варианта они получили направление градиента обновления низкорангового адаптера — малого подключаемого набора обучаемых параметров. Затем исследователи разделили общую для форматов составляющую и остаток, зависящий от сочетания задачи и интерфейса.
Скалярные метрики на основе спектра градиента, включая эффективный ранг, не отличали чистые данные от семантически испорченных лучше установленного авторами диапазона случайного различения. Направление обновления сохраняло полезный сигнал: остаток правильно связывал каждый чистый пример с его целевой задачей во всех проверенных семействах моделей.
При дообучении проявилась привязка навыка к интерфейсу. Модель могла показать прирост только при той же схеме ответа, на которой обучалась. Отдельно авторы обнаружили, что исправление лимита генерации на GSM8K меняло знак измеренного эффекта дообучения: прежний прирост превращался в падение.
Что это значит
Формат ответа следует считать частью протокола оценки, а не нейтральной упаковкой. Для сравнения моделей нужно выравнивать схему ответа, разбор результата, условие остановки и лимит генерации. При отборе данных недостаточно одной спектральной характеристики градиента: метрику стоит проверять на семантических искажениях в нескольких форматах.
Ограничения. Авторы проверяли подход на 12 задачах, четырёх основных интерфейсах и трёх семействах моделей размером менее 10 млрд параметров. Работа сосредоточена на классификации, коротких рассуждениях и низкоранговых адаптерах; длинные ответы и полное дообучение не исследовались. Набор искусственных и естественных искажений не покрывает все дефекты рабочих данных, а испытанная авторами геометрическая коррекция не устранила привязку навыка к формату. Сравнения с более крупными моделями и другими способами дообучения в работе нет.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



