Журнал · Rit.work

Общий кеш случайного инструмента может развернуть обновление политики

Одинаковый ответ инструмента для группы прогонов меняет связь между наградами и может направить обучение в пользу действия с меньшей средней наградой.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Один результат случайного инструмента на несколько обучающих прогонов может заставить алгоритм усиливать действие с меньшей средней наградой. В препринте Shivam Gupta, который не прошёл рецензирование, все приведённые числа получил сам автор: при 64 прогонах независимое исполнение давало обновление −0,078867, а общий кеш — +0,297628. Экономию вызовов нельзя считать нейтральной для обучения только потому, что каждый отдельный ответ распределён правильно.

Работа рассматривает два действия: одно всегда приносит постоянную награду, второе получает случайный результат инструмента. В первом режиме инструмент запускают независимо для каждого прогона, во втором — один результат повторяют для всех одинаковых вызовов внутри группы. Отдельный прогон в обоих случаях видит то же распределение награды, но результаты разных прогонов становятся зависимыми друг от друга.

Групповая нормализация вычитает среднюю награду внутри группы и делит разницу на стандартное отклонение. При общем результате деление убирает величину выигрыша или проигрыша: обновление начинает учитывать, как часто случайное действие побеждает постоянное, а не сколько награды оно приносит в среднем. Поэтому частые небольшие выигрыши могут перевесить редкие крупные потери, хотя средняя награда окажется ниже.

Если оставить только вычитание средней награды и не делить на стандартное отклонение, направление обновления в этой модели сохраняется. Это не делает два режима полностью эквивалентными: распределение обновлений и их разброс всё равно могут различаться.

Механизм проверили точными конечными суммами на 540 сочетаниях параметров. Отдельный аудит TVCache на 256 сценарных прогонах подтвердил техническую возможность такого совместного использования результата, но не измерял качество обучения LLM. Модель работы ограничена двумя действиями, одним решением за прогон, фиксированной политикой и конкретной оценкой градиента.

Для обучающего контура проверять нужно не только корректность отдельного ответа из кеша. Важны совместное распределение результатов внутри группы и способ, которым алгоритм превращает награды в обновление политики. Число физических вызовов инструмента и число обучающих прогонов при этом следует учитывать раздельно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу