Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Haruto Sato, Yuki Tanaka, Ren Nakamura и соавторы предложили Evidence Sufficiency Boundary Training — способ обучать модель переходить от отказа к ответу только после появления достаточного контекста, — в препринте, не прошедшем рецензирование. По замерам авторов, точность нахождения момента перехода составила 80,7% против 78,1% у токенового метода отказа. Подход важен для команд, которые строят поиск ответов по документам и хотят управлять не только правильностью ответа, но и моментом, когда модель получает право отвечать.
Что сделали
Для каждого вопроса авторы собрали последовательность контекстов: не относящийся к ответу, частично подтверждающий его, минимально достаточный и дополненный избыточными сведениями. Модель должна отказываться на первых уровнях, выдавать короткий ответ при достижении границы достаточности и сохранять его после добавления второстепенного контекста.
Обучение объединяет обычную генерацию ответа со штрафами за преждевременный ответ, отсутствие переключения на достаточном контексте и потерю уверенности после границы. Метод проверяли на Qwen2.5-3B-Instruct с адаптацией LoRA. Цепочки построили из HotpotQA, 2WikiMultiHopQA и MuSiQue; обучающий набор включал 2 400 семейств вопросов. На внешних примерах без достаточного ответа доля неподтверждённых ответов по автоматической оценке составила 9,5% против 10,1% у ближайшего токенового метода отказа.
Что это значит
Работа предлагает практичную единицу разметки для систем с поиском контекста: вместо независимых примеров «ответить» и «отказаться» модель видит, как меняется допустимое поведение при добавлении доказательств. Такая схема позволяет отдельно проверять ранние ответы, своевременное включение ответа и устойчивость к лишним фрагментам, тогда как обычная полнота совпадения с эталоном этого не показывает.
Ограничения. Работа не показывает, переносится ли результат на производственные документы, длинные ответы и модели другого масштаба. Проверка проведена на одном базовом семействе модели, одном запуске обучения и коротких ответах из указанных наборов; достаточность контекста и неподтверждённые ответы оценивались автоматически. Сравнение ограничено обычным обучением ответам и адаптированными авторами вариантами SEAL и R-Tuning; при этом SEAL лучше сохранял ответ после границы и немного превосходил метод по качеству обычных ответов. Независимой проверки и человеческой оценки в работе нет.
Источники
Иллюстрация: рисунок из статьи «Learning Evidence Sufficiency Boundaries for Selective Answering in Grounded Multi-Hop QA», Haruto Sato, Yuki Tanaka, Ren Nakamura и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



