Журнал · Rit.work

E-Closure связывает вопрос, рассуждение и ответ при обучении LLM

Проверка отдельных утверждений не замечает цепочки, которые опираются на факты, но отвечают не на тот вопрос или расходятся с итоговым ответом.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В многошаговых ответах нашли систематическую ошибку: каждый шаг опирается на факты, но вся цепочка не отвечает на заданный вопрос или не обосновывает выданный ответ. В работе University of Duisburg-Essen и партнёров почти половина глобально недостаточных ответов оказалась локально корректной; работа пока не рецензирована, а числа получили сами авторы. Для команд это означает, что одной проверки утверждений по источникам недостаточно: нужно отдельно связывать вопрос с ходом рассуждения, а вывод — с итоговым ответом.

Верные шаги не гарантируют правильной цепочки

Авторы разделяют надёжность рассуждения на две части. Локальная корректность означает, что каждый содержательный шаг подтверждается исходными материалами и предыдущими шагами. Глобальная достаточность требует, чтобы вся цепочка решала поставленную задачу и действительно обосновывала ответ, который модель выдала в конце.

Разрыв возникает, когда первое условие выполнено, а второе — нет. Цепочка может уйти к другой цели, остановиться до вывода или установить правильный результат, после чего модель назовёт другой ответ.

Последний случай виден в примере из 2WikiMultiHopQA. Модель правильно определяет режиссёров фильмов Please Give и Moonstruck, сопоставляет годы их рождения и заключает, что раньше родился режиссёр Moonstruck. В поле ответа она всё равно пишет Please Give. Новых фактов здесь не требуется: сломана связь между уже готовым выводом и ответом.

Диагностика охватила 2 598 ответов из 2WikiMultiHopQA, MuSiQue и HotpotQA. Люди отдельно размечали опору каждого шага на факты, соответствие цепочки вопросу и связь вывода с ответом. Среди глобально недостаточных ответов 46,3% оставались локально корректными.

RAGAS, VeriScore и AlignScore сверяют утверждения с доказательствами, поэтому находили не более 11% таких случаев. Отдельная модель-оценщик для соответствия вопросу обнаруживала 66,7% уходов к неверной цели, а проверка связи вывода с ответом — 56,5% случаев, когда цепочка и ответ расходились. Полнота здесь означает долю найденных ошибок среди всех ошибок нужного типа.

E-Closure обучает переключать зависимые части ответа

E-Closure переносит эти проверки из диагностики в обучение. Метод задаёт три зависимости: факты должны поддерживать шаги, вопрос должен определять направление цепочки, а цепочка — итоговый ответ.

Для каждой исходной задачи готовят поддержанный фактами ответ и два контрфактических варианта. В первом меняют один значимый фрагмент доказательств: рассуждение должно сохранить общий префикс, но переключиться на первом затронутом шаге. Во втором меняют цель вопроса, сохраняя доказательства: теперь модель должна построить другую цепочку.

Обучение требует, чтобы предпочтение переключалось в обе стороны. Исходный шаг, цепочка или ответ должны выигрывать на исходном входе, а изменённые — после соответствующей правки. Это не даёт модели просто запомнить, что один вариант в паре обычно лучше другого.

На усреднённых результатах по использованным наборам и базовым моделям E-Closure показал 92,8% точности ответов и 89,0% надёжных цепочек. Доля локально корректных, но глобально недостаточных ответов снизилась до 6,2% — это лучший средний результат среди сопоставленных способов дообучения. Метод не меняет генерацию во время применения модели: дополнительная работа приходится на подготовку данных и обучение.

Что менять в планах продукта

Для систем с поиском по документам проверка цитат и фактических утверждений остаётся необходимой, но больше не может служить единственной проверкой рассуждения. В оценочном наборе стоит разделить три сбоя: неподтверждённый шаг, уход от цели вопроса и ответ, который не следует из собственной цепочки модели.

Команды, которые дообучают модель, могут добавить парные примеры с изменённым доказательством или вопросом. Особенно полезны случаи, где небольшая правка должна изменить ровно один зависимый элемент: первый затронутый шаг, направление цепочки либо ответ. Такие тесты показывают, реагирует ли модель на причинную связь, а не воспроизводит знакомый шаблон.

При работе только через закрытый API саму функцию обучения E-Closure применить нельзя. Однако её схема подходит для внешней оценки: одна проверка сопоставляет шаги с материалами, другая — цепочку с вопросом, третья — ответ с выводом. Это требует дополнительных вызовов модели-оценщика, но закрывает класс ошибок, который обычная проверка фактов почти не видит.

Работу проверяли в контролируемом режиме, где нужные доказательства уже присутствовали в контексте. Ответы генерировали детерминированно модели Qwen3-8B, Qwen3-32B и Ministral-3-8B-Instruct-2512 на задачах вопрос-ответ с несколькими шагами. Поэтому результат прежде всего меняет план тестирования и дообучения таких систем, а не доказывает преимущество метода для произвольных агентных процессов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу