Журнал · Rit.work

Новое меню без нового прогона

Кэш первого прогона помогает оценить смену набора меток у моделей принятия решений без генерации, но тот же приём хуже работает с генеративными LLM.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Точность модели после смены набора доступных меток научились предсказывать по уже сохранённому первому прогону. Работа Ran Li и Lei Chen ещё не прошла рецензирование, а все числа получили сами авторы: ошибка прогноза не превышала 4,2 процентного пункта. Это позволяет сравнивать варианты меню до повторного запуска модели и ручной разметки.

Метод рассчитан на модели принятия решений без генерации. Такая модель один раз читает входной текст, оценивает каждую метку через отдельный выходной блок и сразу выбирает ответ. Если текст остаётся прежним, а из меню убирают часть кандидатов, достаточно взять сохранённые оценки, отбросить исключённые варианты, заново нормировать оставшиеся и выбрать лидера.

Результат зависит от порядка кандидатов, а не от точности самих вероятностей. Оценка по числам уверенности ошибалась более чем на порядок сильнее, чем выбор по месту кандидата в списке. Поэтому обычная калибровка уверенности, которая согласует оценки модели с фактической частотой ошибок, это свойство не воспроизводит.

Проверка охватывала семь семейств моделей, классификацию и выставление оценки по упорядоченной шкале. Меню строили случайно, через поиск похожих вариантов, по алфавиту и из кандидатов, выбранных самой моделью. Для генеративных моделей сопоставимого размера тот же способ давал ошибку от 1,6 до 15,8 процентного пункта: у них список вариантов входит в запрос, поэтому его изменение перестраивает вычисление, а не только отсекает выходы.

Граница применимости проходит по типу вмешательства: входной текст и модель должны оставаться неизменными, меняется только набор кандидатов. В этих условиях команда может перебрать меню по кэшу, а вычислительный бюджет направить на каскад: сомнительные запросы передавать более крупной модели. В опытах такой каскад при равных затратах обошёл повторные запросы к той же модели, а отбор кандидатов иногда дал больший выигрыш, чем увеличение самой модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу