Журнал · Rit.work

DEX-Comp учит сжатый RAG на ошибках исходной модели

DEX-Comp переносит в сжатую модель только верные ответы исходного RAG, а затем обучается с подкреплением на запросах, где тот ошибся.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему RAG, которая дополняет ответ найденными документами, научили читать их в сжатом виде без потери точности. DEX-Comp сокращает контекст в 16 раз и ускоряет выдачу первого токена от 4 до 24 раз, хотя работа не рецензирована и числа получили сами авторы. Рецепт предлагает альтернативу росту контекстного окна там, где одни документы используют для множества запросов.

Верные ответы копируют, на ошибках ищут свой способ

Мягкое сжатие заменяет текст документа короткой последовательностью непрерывных векторов. Компрессор создаёт их заранее, а отдельный декодер получает найденные векторы вместе с запросом и генерирует ответ.

Такое сжатие не зависит от запроса. Каждый документ обрабатывают один раз, сохраняют в индексе и повторно используют при поиске. Это убирает компрессор из основного пути запроса, но требует обновлять векторы при изменении корпуса.

Предыдущие методы обычно переносили в сжатую модель поведение исходного RAG целиком. Вместе с полезными способами рассуждения модель перенимала ошибки и училась работать так, будто перед ней обычные текстовые токены, а не плотное представление документа.

DEX-Comp делит обучение на два этапа. Сначала сжатая модель имитирует распределение ответов исходной модели только на запросах, где ответ совпал с эталоном. Это даёт рабочую начальную настройку компрессора и декодера, но не закрепляет заведомо неверные ответы.

Затем модель обучают с подкреплением только на запросах, где исходный RAG ошибся. Она генерирует несколько вариантов, получает награду за совпадение с эталоном и меняет как декодер, так и компрессор. Поэтому ошибки исходной модели становятся не примерами для копирования, а задачами, на которых сжатая система ищет собственный способ использовать документы.

Метод проверили на пяти наборах открытых вопросов: Natural Questions, TriviaQA, HotpotQA, ASQA и PopQA. Поиск возвращал от 5 до 30 документов, а все сравниваемые системы использовали Mistral-7B или его дообученный вариант.

Сжатая модель обошла несжатую на всех глубинах поиска

При одинаковой глубине на обучении и проверке DEX-Comp обошёл несжатый RAG на каждом наборе и при каждом числе найденных документов. На самой большой глубине средний выигрыш составил от 2,5 до 3,1 пункта в зависимости от метрики, а разница была статистически значимой.

Первую метрику считали по наличию эталонного ответа в выводе модели. Вторую выставляла модель-оценщик Gemini 3 Flash, которая сравнивала ответ с эталоном. Полный запрос к оценщику приведён в работе, но сама модель остаётся закрытой, поэтому первая метрика даёт более воспроизводимую проверку.

Одна версия DEX-Comp, обученная для самой глубокой выдачи, сохранила среднее преимущество и на более коротких списках документов. Исключением стал PopQA на двух меньших глубинах. Обучение под ожидаемую глубину всё же давало лучший результат, поэтому универсальная версия подходит скорее для систем с меняющимся числом найденных документов.

Замеры скорости проводили на одной GPU с уже подготовленными векторами документов. Они отражают задержку рабочего запроса, но не включают предварительное сжатие корпуса. Выигрыш рос вместе с длиной выдачи, поскольку несжатый RAG каждый раз заново обрабатывал весь текст.

Проверка охватывает ответы на вопросы и оценивает их правильность. Она не устанавливает, насколько ответы опираются именно на найденные документы, сохраняют цитаты и остаются надёжными в длинной генерации.

Для внедрения нужен управляемый декодер, а не новый шаблон запроса

DEX-Comp лучше соответствует корпусам, которые меняются реже, чем по ним задают вопросы: внутренним базам знаний, архивам документов и справочным коллекциям. Предварительная обработка окупается повторным использованием векторов, а изменённые документы можно пересжимать отдельно.

Это не замена текста перед вызовом обычного API. Компрессор и декодер обучаются совместно, а декодер должен принимать непрерывные векторы вместо исходных токенов. В экспериментах их реализовали как отдельные адаптеры LoRA поверх одной базовой модели, поэтому команде нужен доступ к весам и собственный контур выдачи.

Главная оговорка для архитектурного решения связана со сравнением. Несжатый RAG не обучали с подкреплением под задачу, тогда как DEX-Comp проходил такой этап. Работа показывает полезность всего рецепта, но не отделяет эффект сжатия от эффекта дополнительного обучения на сложных запросах.

Поэтому результат пока меняет план эксперимента, а не автоматически выбор рабочей архитектуры. Если задержку создаёт обработка многих найденных документов, имеет смысл сравнить DEX-Comp с несжатой системой, которая получила сопоставимое дообучение, и отдельно проверить качество ссылок на источники. Для часто обновляемого корпуса к этому сравнению добавится стоимость пересчёта и хранения векторов.

Источники

Иллюстрация: рисунок из статьи «Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG», Shuyu Guo, Shuo Zhang, Zhaochun Ren, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу