Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель научили улучшать ответы на новых задачах без разметки и изменения её основных весов. Работа University of Turku и ELLIS Institute Finland показала, что для этого достаточно небольшого набора смещений; поскольку препринт не прошёл рецензирование, все числа в нём получены самими авторами. Подход сокращает объём обучаемых параметров, но сохраняет основную вычислительную статью расходов — многократную генерацию ответов.
Как обучение поместили в смещения
Обычное обучение с подкреплением во время применения (test-time reinforcement learning) обновляет модель прямо на задачах, которые ей предстоит решать. Вместо правильных ответов оно использует сигнал, собранный из нескольких собственных попыток модели.
В новой схеме основная модель остаётся замороженной. В выход каждого полносвязного блока декодера добавляют обучаемый вектор смещения. Для Qwen он занимает 100 352 параметра: после обучения эти векторы сохраняют как отдельный артефакт и подключают при генерации.
Для каждой задачи модель создаёт от 32 до 64 вариантов решения. Система извлекает итоговые ответы, выбирает самый частый как псевдометку и награждает совпавшие с ней варианты. GRPO сравнивает награды внутри этой группы и передаёт градиенты только в векторы смещения.
Все остальные параметры, включая внимание, эмбеддинги и нормализацию, не меняются. Обучение длится 200 шагов. Поэтому метод почти устраняет память под состояния оптимизатора для основной модели, но не расходы на активации и генерацию десятков вариантов каждого ответа.
Это не обычная параметрически эффективная настройка. LoRA меняет преобразования внутри модели через низкоранговые матрицы, а здесь один постоянный вектор сдвигает выход слоя независимо от входного состояния. Эксперименты показывают, что при равном бюджете важно не только число параметров, но и место, где они встроены.
Почему голосование даёт пригодную награду
Голосование работает, когда правильный ответ уже встречается чаще любого отдельного неправильного ответа. Дополнительные попытки тогда снижают вероятность, что случайный конкурент станет победителем. Чем единодушнее группа, тем надёжнее её псевдометка.
Но голосование не проверяет истинность. Если модель уверенно повторяет одну ошибку, схема назначает её правильным ответом и может закрепить. Метод использует скрытое преимущество правильного варианта в исходном распределении ответов, а не создаёт знание, которого в модели не было.
Второе условие касается обучаемого пространства. Полный градиент показывает, как стоило бы изменить всю модель, однако настройка смещений получает только ту его часть, которая попадает в выбранные направления. Авторы называют её доступной энергией градиента: чем она выше, тем больше полезного сигнала может использовать небольшой вектор.
Проверка отдельных слоёв подтвердила эту связь: одинаковые по размеру смещения обучались по-разному, а слои с большей доступной энергией давали более высокую итоговую точность. Связь оказалась статистически значимой. Это объясняет, почему равные бюджеты у смещений, LoRA и ReFT не дали равного результата.
Метод сокращает состояние обучения, но не заменяет проверку
На MATH-500 схема достигла точности 79,50% с Qwen2.5-Math-7B и 76,67% с Qwen2.5-7B. Она слегка превзошла воспроизведённую авторами настройку смещений с размеченной наградой, хотя обучала в 76 000 раз меньше параметров, чем полное TTRL.
Полученные векторы перенесли на 4 500 отделённых задач MATH, поэтому эффект не ограничился примерами, на которых шла адаптация. При одинаковом бюджете смещения также обошли LoRA на всех проверенных наборах, тогда как ReFT на большинстве наборов закончил ниже исходной модели.
Границы проверки широки по типам данных, но узки по семейству моделей. Эксперименты провели на Qwen для текста, изображений и аудио; использовали MATH-500, MathVista, AI2D, LogicVista и MMAU. Качество оценивали по одному жадно сгенерированному ответу.
Мультимодальные результаты требуют разбирать по типам задач. На AI2D часть прироста связана с тем, что модель чаще соблюдала формат ответа и официальный анализатор мог его извлечь. В MMAU заметную долю улучшения дал шаблон с подсчётом фонем, хотя после его исключения эффект сохранился. На MathVista обнаружился узкий шаблон возрастных задач, где модель повторяла один ответ.
Для продуктовой команды метод меняет архитектуру адаптации, если основную модель нельзя или дорого переобучать: небольшой набор смещений проще хранить, переключать и версионировать для разных доменов. Однако экономию нельзя оценивать только по числу обучаемых параметров. Нужны многократные генерации, поддержка вмешательства во внутренние слои и контрольные задачи с проверенными ответами, иначе уверенная ошибка превратится в обучающий сигнал.
Источники
Иллюстрация: рисунок из статьи «Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces», Naveen Vakada, Mingyuan Li, Shaoxiong Ji, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



