Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Набор примеров в подсказке можно улучшить одним изменением вместо перебора множества вариантов. На TREC метод поднял точность Qwen2.5-7B-Instruct с 65,4% до 80,6%, увеличив общее время обработки на 11%; поскольку препринт не рецензирован, все числа в нём получили сами авторы. Для продукта это означает, что качество обучения на контексте можно повышать отдельным небольшим модулем, не меняя целевую LLM.
Как одно изменение заменяет перебор контекстов
Обучение на контексте (in-context learning, ICL) позволяет дать модели несколько примеров задачи прямо в подсказке. Такие примеры часто называют демонстрациями: каждый содержит входные данные и правильный ответ, по которым модель должна понять формат и логику задачи.
Обычный селектор выбирает демонстрации по близости к новому запросу. Semantic TopK использует смысловую близость, BM25 — совпадения слов. Проблема в том, что похожий пример не обязательно помогает целевой модели ответить правильно, а лишний или повторяющийся пример занимает контекст и может снизить точность.
Глобальный поиск лучшего набора быстро становится непрактичным: каждый вариант нужно проверить через целевую модель, а число сочетаний растёт вместе с пулом кандидатов. Jiarong Wen с коллегами ограничили поиск ближайшими вариантами уже найденного набора. Их метод LDE разрешает оставить набор без изменений, удалить один пример или заменить один пример другим кандидатом.
Решение принимает Jev-LDE — редактор на основе Qwen3-1.7B. Он получает инструкцию задачи, запрос, исходные демонстрации и кандидатов на замену, после чего возвращает одно структурированное действие. Если редактор выдаёт некорректную команду, система сохраняет исходный набор.
Редактор обучают с подкреплением на размеченных запросах. Замороженная Meta-Llama-3-8B-Instruct решает задачу после каждого предложенного изменения, а Jev-LDE получает бинарную награду: ответ правильный или ошибочный. Так затраты на проверку вариантов переносятся в обучение, а при рабочем запросе редактор вызывается один раз, после чего целевая LLM тоже выполняет один вывод.
Локальный выбор оказался важнее размера пула
В среднем по TREC, DBPedia и Banking77 при одном примере Jev-LDE повысил точность Semantic TopK с 81,2% до 88,1%. Случайные изменения такого эффекта не давали: редактору нужно научиться учитывать запрос, содержимое примеров и поведение целевой модели.
Метод улучшил результат во всех 24 сочетаниях исходного селектора, целевой модели и размера набора, которые вошли в отдельную проверку. В качестве отправной точки использовали BM25, CASE и TopK+ConE. Это важная деталь для архитектуры: LDE не требует отказаться от действующего поиска примеров, а работает после него.
Расширение пула кандидатов само по себе не гарантировало прироста. Редактору сложнее выбрать замену, если ему передать больше внешне подходящих вариантов. Работа тем самым поддерживает более узкую схему: сначала обычный поиск сокращает пространство, затем обученная политика делает одно локальное исправление.
Основные замеры охватывают классификацию вопросов, тем и банковских намерений на моделях семейств Qwen и Llama. Перенос без повторного обучения проверяли на SST-2, AQuA-RAT, TACRED и других отложенных наборах, а также на DeepSeek-V4-Flash. Поэтому результаты лучше всего обосновывают применение в задачах с коротким проверяемым ответом; для свободной генерации работа не устанавливает такой же эффект.
Когда стоит менять планы продукта
Работа меняет планы команд, которые уже добавляют в подсказку примеры из базы и обслуживают много однотипных запросов. Вместо усложнения поиска или многократного вызова дорогой целевой модели можно поставить между поиском и генерацией небольшой редактор. Целевую модель при этом не дообучают и не открывают доступ к её параметрам.
Цена этой схемы — отдельный цикл подготовки редактора. Нужны размеченные запросы, пул корректных демонстраций и возможность многократно вызывать замороженную целевую модель во время обучения. Если задача редко повторяется или правильность ответа нельзя автоматически проверить, бинарная награда из работы переносится хуже.
Для пилота достаточно сохранить текущий селектор и сравнить его с тем же селектором плюс Jev-LDE при одинаковых подсказках и правилах проверки ответов. Измерять следует не только точность, но и полное время запроса: дополнительный вызов редактора остаётся в рабочем контуре, хотя он и заменяет итеративную оценку множества наборов.
Менять основную LLM ради этого подхода не требуется. Более существенное архитектурное решение — выделить выбор демонстраций в обучаемый компонент и принять расходы на его подготовку. Препринт показывает, что такой компонент переносится между несколькими наборами данных и моделями, но производственный тест всё равно должен повторять реальные классы запросов и текущий пул примеров.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



