Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
FORGE научился для каждого запроса выбирать, передать ли закрытой LLM исходные документы, сжатую выжимку или только вопрос, а затем назначить глубину рассуждения. Xi Xiao и коллеги получили более точные ответы примерно при вдвое меньшем расходе токенов, хотя препринт не рецензирован и все числа в нём получили сами авторы. Такой маршрутизатор позволяет менять поведение модели через входные данные и режим вывода, не дообучая её.
Как маршрутизатор связывает контекст и рассуждение
Обычная система с поиском по документам применяет один режим ко всем запросам: всегда добавляет полные фрагменты, всегда сжимает их или всегда включает усиленное рассуждение. FORGE рассматривает контекст и глубину рассуждения как одно решение. Полезность дополнительного рассуждения зависит от качества переданных фактов, а объём нужных фактов — от способности модели рассуждать.
Маршрутизатор выбирает одну из трёх форм поддержки. Direct отправляет только вопрос, Summary извлекает предложения из найденных документов с учётом запроса, Raw передаёт полные найденные фрагменты. Для обычных моделей каждую форму можно сочетать с прямым ответом или подсказкой рассуждать по шагам; для моделей с управляемым бюджетом добавляются низкий и высокий режимы рассуждения.
Каждое сочетание получает оценку полезности: качество ответа минус штрафы за входные и выходные токены. Качество измеряют через F1 — метрику, которая учитывает точность и полноту совпадения ответа с эталоном. Вес штрафов задаёт нужный компромисс: система может беречь токены агрессивнее или предпочитать качество.
Обучение идёт вокруг неизменной основной модели. Сначала несколько вариантов запускают на размеченных запросах и записывают качество и расход токенов. Затем маршрутизатор учится воспроизводить распределение Больцмана: действия с большей полезностью получают большую вероятность, но остальные не исчезают полностью. На последнем этапе GRPO уточняет политику по ответам основной модели.
В опубликованной конфигурации этот этап потребовал 1,28 млн завершений LLM. Это существенная цена подготовки маршрутизатора: FORGE не требует доступа к весам, но требует размеченных ответов, вычислительного бюджета и возможности многократно вызывать выбранную модель.
Экономия появляется только при правильном подсчёте вызовов
На Qwen3-8B FORGE прибавил 2,4 пункта среднего по задачам F1 относительно постоянной передачи полных фрагментов и сократил учтённые токены ответа на 45%. На Mistral-7B выигрыш составил 2,9 пункта при сокращении на 42%. В обоих случаях маршрутизатор улучшил не только стоимость, но и качество: лишний контекст и длинное рассуждение иногда мешали модели.
На моделях с управляемым бюджетом совместный выбор контекста и глубины рассуждения также оказался лучше постоянной передачи полных документов с максимальным бюджетом. Перенос маршрутизатора, обученного на Qwen3-8B, на другие семейства моделей без дополнительного обучения в основном сохранил качество и снизил расход токенов. Это указывает, что политика частично изучает свойства запросов, а не только особенности одной LLM.
Но основной результат считает кэшированную стоимость: признаки для маршрутизации уже подготовлены и в расход входит выбранный ответ. Полная версия FORGE на новом запросе делает четыре предварительных вызова модели, чтобы оценить уверенность и согласованность ответов. Они повышают качество, но увеличивают задержку и съедают часть экономии.
FORGE-Lite убирает эти вызовы и использует только представление запроса, статистику поиска BM25 и структурные признаки. На Qwen3-8B он сократил полный онлайн-расход токенов на 44% и прибавил 1,6 пункта F1 относительно постоянной передачи исходных фрагментов. Поэтому именно Lite ближе к варианту для API, где каждый дополнительный вызов оплачивается и влияет на задержку.
Когда FORGE меняет архитектурный план
Работа предлагает заменить фиксированную схему RAG на отдельный маршрутизатор перед LLM. Это имеет смысл, если запросы неоднородны: часть можно закрыть знаниями самой модели, части достаточно короткой выжимки, а полные документы и долгие рассуждения нужны лишь отдельным случаям. Для одинаковых запросов дополнительная политика только усложнит систему.
Практический выбор проходит между двумя вариантами. FORGE-Lite сохраняет один вызов основной модели и подходит для внешнего API или сервиса с жёсткой задержкой. Полная версия уместна там, где признаки можно заранее посчитать, закэшировать или получить параллельно, а дополнительное качество окупает предварительные обращения.
Проверка охватывает задачи с поиском фактов и многошаговыми вопросами, а модели различаются по масштабу от 7B до 671B параметров. По результатам нельзя переносить вывод на диалоги, генерацию кода или процессы с инструментами без отдельного замера. Кроме того, денежная экономия зависит от тарифов конкретного API: работа сравнивает токены и задержку, а не итоговый счёт провайдера.
Для команды, которая уже использует закрытую LLM и RAG, FORGE не требует менять поставщика или получать веса модели. План меняется в другом месте: вместо настройки одного шаблона контекста появляется обучаемая политика, а в контур оценки нужно включить качество ответа, входные токены, выходные токены и задержку нового запроса.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



