Журнал · Rit.work

FORGE выбирает контекст и глубину рассуждения для закрытой LLM

FORGE подбирает для каждого запроса форму контекста и бюджет рассуждения, сокращая расход токенов без доступа к весам основной модели.

Rit.work
Студия разработки
30 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

FORGE научился для каждого запроса выбирать, передать ли закрытой LLM исходные документы, сжатую выжимку или только вопрос, а затем назначить глубину рассуждения. Xi Xiao и коллеги получили более точные ответы примерно при вдвое меньшем расходе токенов, хотя препринт не рецензирован и все числа в нём получили сами авторы. Такой маршрутизатор позволяет менять поведение модели через входные данные и режим вывода, не дообучая её.

Как маршрутизатор связывает контекст и рассуждение

Обычная система с поиском по документам применяет один режим ко всем запросам: всегда добавляет полные фрагменты, всегда сжимает их или всегда включает усиленное рассуждение. FORGE рассматривает контекст и глубину рассуждения как одно решение. Полезность дополнительного рассуждения зависит от качества переданных фактов, а объём нужных фактов — от способности модели рассуждать.

Маршрутизатор выбирает одну из трёх форм поддержки. Direct отправляет только вопрос, Summary извлекает предложения из найденных документов с учётом запроса, Raw передаёт полные найденные фрагменты. Для обычных моделей каждую форму можно сочетать с прямым ответом или подсказкой рассуждать по шагам; для моделей с управляемым бюджетом добавляются низкий и высокий режимы рассуждения.

Каждое сочетание получает оценку полезности: качество ответа минус штрафы за входные и выходные токены. Качество измеряют через F1 — метрику, которая учитывает точность и полноту совпадения ответа с эталоном. Вес штрафов задаёт нужный компромисс: система может беречь токены агрессивнее или предпочитать качество.

Обучение идёт вокруг неизменной основной модели. Сначала несколько вариантов запускают на размеченных запросах и записывают качество и расход токенов. Затем маршрутизатор учится воспроизводить распределение Больцмана: действия с большей полезностью получают большую вероятность, но остальные не исчезают полностью. На последнем этапе GRPO уточняет политику по ответам основной модели.

В опубликованной конфигурации этот этап потребовал 1,28 млн завершений LLM. Это существенная цена подготовки маршрутизатора: FORGE не требует доступа к весам, но требует размеченных ответов, вычислительного бюджета и возможности многократно вызывать выбранную модель.

Экономия появляется только при правильном подсчёте вызовов

На Qwen3-8B FORGE прибавил 2,4 пункта среднего по задачам F1 относительно постоянной передачи полных фрагментов и сократил учтённые токены ответа на 45%. На Mistral-7B выигрыш составил 2,9 пункта при сокращении на 42%. В обоих случаях маршрутизатор улучшил не только стоимость, но и качество: лишний контекст и длинное рассуждение иногда мешали модели.

На моделях с управляемым бюджетом совместный выбор контекста и глубины рассуждения также оказался лучше постоянной передачи полных документов с максимальным бюджетом. Перенос маршрутизатора, обученного на Qwen3-8B, на другие семейства моделей без дополнительного обучения в основном сохранил качество и снизил расход токенов. Это указывает, что политика частично изучает свойства запросов, а не только особенности одной LLM.

Но основной результат считает кэшированную стоимость: признаки для маршрутизации уже подготовлены и в расход входит выбранный ответ. Полная версия FORGE на новом запросе делает четыре предварительных вызова модели, чтобы оценить уверенность и согласованность ответов. Они повышают качество, но увеличивают задержку и съедают часть экономии.

FORGE-Lite убирает эти вызовы и использует только представление запроса, статистику поиска BM25 и структурные признаки. На Qwen3-8B он сократил полный онлайн-расход токенов на 44% и прибавил 1,6 пункта F1 относительно постоянной передачи исходных фрагментов. Поэтому именно Lite ближе к варианту для API, где каждый дополнительный вызов оплачивается и влияет на задержку.

Когда FORGE меняет архитектурный план

Работа предлагает заменить фиксированную схему RAG на отдельный маршрутизатор перед LLM. Это имеет смысл, если запросы неоднородны: часть можно закрыть знаниями самой модели, части достаточно короткой выжимки, а полные документы и долгие рассуждения нужны лишь отдельным случаям. Для одинаковых запросов дополнительная политика только усложнит систему.

Практический выбор проходит между двумя вариантами. FORGE-Lite сохраняет один вызов основной модели и подходит для внешнего API или сервиса с жёсткой задержкой. Полная версия уместна там, где признаки можно заранее посчитать, закэшировать или получить параллельно, а дополнительное качество окупает предварительные обращения.

Проверка охватывает задачи с поиском фактов и многошаговыми вопросами, а модели различаются по масштабу от 7B до 671B параметров. По результатам нельзя переносить вывод на диалоги, генерацию кода или процессы с инструментами без отдельного замера. Кроме того, денежная экономия зависит от тарифов конкретного API: работа сравнивает токены и задержку, а не итоговый счёт провайдера.

Для команды, которая уже использует закрытую LLM и RAG, FORGE не требует менять поставщика или получать веса модели. План меняется в другом месте: вместо настройки одного шаблона контекста появляется обучаемая политика, а в контур оценки нужно включить качество ответа, входные токены, выходные токены и задержку нового запроса.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу