Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
В многошаговых ответах нашли систематическую ошибку: каждый шаг опирается на факты, но вся цепочка не отвечает на заданный вопрос или не обосновывает выданный ответ. В работе University of Duisburg-Essen и партнёров почти половина глобально недостаточных ответов оказалась локально корректной; работа пока не рецензирована, а числа получили сами авторы. Для команд это означает, что одной проверки утверждений по источникам недостаточно: нужно отдельно связывать вопрос с ходом рассуждения, а вывод — с итоговым ответом.
Верные шаги не гарантируют правильной цепочки
Авторы разделяют надёжность рассуждения на две части. Локальная корректность означает, что каждый содержательный шаг подтверждается исходными материалами и предыдущими шагами. Глобальная достаточность требует, чтобы вся цепочка решала поставленную задачу и действительно обосновывала ответ, который модель выдала в конце.
Разрыв возникает, когда первое условие выполнено, а второе — нет. Цепочка может уйти к другой цели, остановиться до вывода или установить правильный результат, после чего модель назовёт другой ответ.
Последний случай виден в примере из 2WikiMultiHopQA. Модель правильно определяет режиссёров фильмов Please Give и Moonstruck, сопоставляет годы их рождения и заключает, что раньше родился режиссёр Moonstruck. В поле ответа она всё равно пишет Please Give. Новых фактов здесь не требуется: сломана связь между уже готовым выводом и ответом.
Диагностика охватила 2 598 ответов из 2WikiMultiHopQA, MuSiQue и HotpotQA. Люди отдельно размечали опору каждого шага на факты, соответствие цепочки вопросу и связь вывода с ответом. Среди глобально недостаточных ответов 46,3% оставались локально корректными.
RAGAS, VeriScore и AlignScore сверяют утверждения с доказательствами, поэтому находили не более 11% таких случаев. Отдельная модель-оценщик для соответствия вопросу обнаруживала 66,7% уходов к неверной цели, а проверка связи вывода с ответом — 56,5% случаев, когда цепочка и ответ расходились. Полнота здесь означает долю найденных ошибок среди всех ошибок нужного типа.
E-Closure обучает переключать зависимые части ответа
E-Closure переносит эти проверки из диагностики в обучение. Метод задаёт три зависимости: факты должны поддерживать шаги, вопрос должен определять направление цепочки, а цепочка — итоговый ответ.
Для каждой исходной задачи готовят поддержанный фактами ответ и два контрфактических варианта. В первом меняют один значимый фрагмент доказательств: рассуждение должно сохранить общий префикс, но переключиться на первом затронутом шаге. Во втором меняют цель вопроса, сохраняя доказательства: теперь модель должна построить другую цепочку.
Обучение требует, чтобы предпочтение переключалось в обе стороны. Исходный шаг, цепочка или ответ должны выигрывать на исходном входе, а изменённые — после соответствующей правки. Это не даёт модели просто запомнить, что один вариант в паре обычно лучше другого.
На усреднённых результатах по использованным наборам и базовым моделям E-Closure показал 92,8% точности ответов и 89,0% надёжных цепочек. Доля локально корректных, но глобально недостаточных ответов снизилась до 6,2% — это лучший средний результат среди сопоставленных способов дообучения. Метод не меняет генерацию во время применения модели: дополнительная работа приходится на подготовку данных и обучение.
Что менять в планах продукта
Для систем с поиском по документам проверка цитат и фактических утверждений остаётся необходимой, но больше не может служить единственной проверкой рассуждения. В оценочном наборе стоит разделить три сбоя: неподтверждённый шаг, уход от цели вопроса и ответ, который не следует из собственной цепочки модели.
Команды, которые дообучают модель, могут добавить парные примеры с изменённым доказательством или вопросом. Особенно полезны случаи, где небольшая правка должна изменить ровно один зависимый элемент: первый затронутый шаг, направление цепочки либо ответ. Такие тесты показывают, реагирует ли модель на причинную связь, а не воспроизводит знакомый шаблон.
При работе только через закрытый API саму функцию обучения E-Closure применить нельзя. Однако её схема подходит для внешней оценки: одна проверка сопоставляет шаги с материалами, другая — цепочку с вопросом, третья — ответ с выводом. Это требует дополнительных вызовов модели-оценщика, но закрывает класс ошибок, который обычная проверка фактов почти не видит.
Работу проверяли в контролируемом режиме, где нужные доказательства уже присутствовали в контексте. Ответы генерировали детерминированно модели Qwen3-8B, Qwen3-32B и Ministral-3-8B-Instruct-2512 на задачах вопрос-ответ с несколькими шагами. Поэтому результат прежде всего меняет план тестирования и дообучения таких систем, а не доказывает преимущество метода для произвольных агентных процессов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



