Журнал · Rit.work

Модель учат ждать достаточных доказательств перед ответом

Авторы предложили обучение, которое задаёт модели границу между отказом и ответом по мере накопления подтверждающего контекста.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Haruto Sato, Yuki Tanaka, Ren Nakamura и соавторы предложили Evidence Sufficiency Boundary Training — способ обучать модель переходить от отказа к ответу только после появления достаточного контекста, — в препринте, не прошедшем рецензирование. По замерам авторов, точность нахождения момента перехода составила 80,7% против 78,1% у токенового метода отказа. Подход важен для команд, которые строят поиск ответов по документам и хотят управлять не только правильностью ответа, но и моментом, когда модель получает право отвечать.

Что сделали

Для каждого вопроса авторы собрали последовательность контекстов: не относящийся к ответу, частично подтверждающий его, минимально достаточный и дополненный избыточными сведениями. Модель должна отказываться на первых уровнях, выдавать короткий ответ при достижении границы достаточности и сохранять его после добавления второстепенного контекста.

Обучение объединяет обычную генерацию ответа со штрафами за преждевременный ответ, отсутствие переключения на достаточном контексте и потерю уверенности после границы. Метод проверяли на Qwen2.5-3B-Instruct с адаптацией LoRA. Цепочки построили из HotpotQA, 2WikiMultiHopQA и MuSiQue; обучающий набор включал 2 400 семейств вопросов. На внешних примерах без достаточного ответа доля неподтверждённых ответов по автоматической оценке составила 9,5% против 10,1% у ближайшего токенового метода отказа.

Что это значит

Работа предлагает практичную единицу разметки для систем с поиском контекста: вместо независимых примеров «ответить» и «отказаться» модель видит, как меняется допустимое поведение при добавлении доказательств. Такая схема позволяет отдельно проверять ранние ответы, своевременное включение ответа и устойчивость к лишним фрагментам, тогда как обычная полнота совпадения с эталоном этого не показывает.

Ограничения. Работа не показывает, переносится ли результат на производственные документы, длинные ответы и модели другого масштаба. Проверка проведена на одном базовом семействе модели, одном запуске обучения и коротких ответах из указанных наборов; достаточность контекста и неподтверждённые ответы оценивались автоматически. Сравнение ограничено обычным обучением ответам и адаптированными авторами вариантами SEAL и R-Tuning; при этом SEAL лучше сохранял ответ после границы и немного превосходил метод по качеству обычных ответов. Независимой проверки и человеческой оценки в работе нет.

Источники

Иллюстрация: рисунок из статьи «Learning Evidence Sufficiency Boundaries for Selective Answering in Grounded Multi-Hop QA», Haruto Sato, Yuki Tanaka, Ren Nakamura и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу