Журнал · Rit.work

Экспоненциальный шум ускорил выбор ответа из нескольких вариантов

ExpBoN приближает распределение ответов к целевому быстрее прежнего мягкого отбора, а его интеграция в GSI сокращает число дорогих проверок большой моделью.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Выбирать ответ LLM из набора кандидатов научились с меньшим числом проверок большой моделью. ExpGSI сократил расчётную вычислительную работу на 14–39% для Qwen2.5-Math и до 45% для Qwen3 при сопоставимой точности; поскольку препринт не рецензирован, все числа в нём получили сами авторы. Метод может снизить расходы в системах, которые во время генерации ранжируют несколько вариантов ответа.

Обычный выбор лучшего из n генерирует несколько ответов и возвращает вариант с максимальной оценкой. Чем больше кандидатов, тем сильнее результат отклоняется от исходного поведения модели и тем выше риск использовать ошибку модели оценки. ExpBoN вместо жёсткого максимума добавляет к оценкам экспоненциальный шум, а параметр температуры позволяет отдельно управлять качеством ответа и величиной отклонения.

Предыдущий мягкий метод SBoN приближается к целевому распределению с полиномиальной скоростью. У ExpBoN остаточная ошибка убывает геометрически: каждый дополнительный кандидат сокращает её в постоянное число раз. В численном примере при десяти кандидатах разрыв по ожидаемой награде составил 0,042 против 0,171 у SBoN — примерно вчетверо меньше.

Сам по себе новый способ отбора не уменьшает объём вычислений. Экономия появляется в ExpGSI: небольшая черновая модель предлагает шаги рассуждения, а большая модель проверяет их. Ограниченная сверху оценка позволяет досрочно остановить проверку кандидатов, не меняя итоговое распределение относительно этого правила; дорогие обращения к большой модели для оставшихся вариантов не нужны.

Подход проверяли на MATH500, MMLU-STEM и Minerva Math с семействами Qwen2.5-Math и Qwen3 при бюджете до 16 кандидатов. Сравнивали с GSI, который использует SBoN, а расходы оценивали в операциях с плавающей точкой на задачу. Различия в точности не имели устойчивого направления, однако ограничение оценки меняет целевое распределение по сравнению с исходным GSI — этот параметр придётся настраивать вместе с моделью награды.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу