Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM научили оставлять расследование открытым, даже если модель уже нашла правдоподобную причину инцидента. В препринте Peking University, который не прошёл рецензирование и содержит замеры самих авторов, Gemini 3.8 Flash верно определяла причину в 84% случаев, но преувеличивала силу доказательств в 91% ответов. Для расследующего агента нужен отдельный навык: понять, когда собранных фактов достаточно для окончательного вывода.
Почему правильная причина ещё не означает закрытое дело
Обычная проверка LLM спрашивает, нашла ли модель правильный ответ. В расследовании этого мало: отчёт может установить отказ двигателя, но оставить причину отказа неопределённой. Модель должна либо закрыть дело и связать вывод с прочитанными материалами, либо оставить его открытым и назвать недостающие доказательства.
Авторы собрали Nautil из 731 проверенного дела. В набор вошли отчёты об авиационных, железнодорожных и морских происшествиях, химической безопасности, дефектах автомобилей и сбоях производственных серверов.
Агент получает краткое описание, несколько первых свидетельств и указатель остальных материалов с нейтральными названиями. Затем он запрашивает документы, обновляет гипотезы и решает, закрывать ли дело. В ответе требуется сослаться на прочитанные свидетельства; для открытого дела — отделить установленное от предположений и указать, чего не хватает.
Обучающие траектории построены по логике готовых отчётов: модель-учитель заранее знала официальный вывод и восстанавливала путь к нему. Поэтому Nautil проверяет, может ли агент повторить дисциплину документированного расследования, а не самостоятельно открыть новую причину при свободном поиске.
Основные замеры провели на делах из трёх источников официальных отчётов; серверные инциденты вынесли из главного сравнения, поскольку их метки поставила модель-учитель. Дополнительно модели проверяли на других транспортных отчётах, медицинских случаях, сбоях микросервисов и промышленного процесса. Контрольную точку Nautil-RLVR выбрали после проверки на части тестовых дел, поэтому её итоговую точность нельзя считать полностью независимой оценкой.
Как проверяли, зависит ли вердикт от доказательств
Метка дела тесно связана с источником. В выборке транспортные комиссии и серверные отчёты чаще устанавливают причину, а авиационные и автомобильные расследования чаще заканчиваются без неё. Простое правило, которое смотрит только на источник, получило 83% сбалансированной точности — среднего качества на закрытых и открытых делах.
Поэтому одного итогового показателя недостаточно. Авторы отдельно считали точность внутри каждого источника: так модель не может получить высокий результат, угадывая типичный исход ведомства. Политика «никогда не закрывать» тоже не выигрывает, поскольку ошибки на закрытых и открытых делах имеют одинаковый вес.
Вторая проверка меняет сами материалы дела. Из файла удаляют свидетельства, на которых держится вывод, а из контрольной версии — столько же посторонних элементов. Если агент опирается на доказательства, после первого удаления он должен чаще оставлять дело открытым, а после второго — сохранять вердикт.
Третья проверка оценивает содержание ответа. Модель-оценщик сверяет причину и причинную цепочку, ищет преувеличения, проверяет ссылки на прочитанные материалы и работу с альтернативными объяснениями. Для открытого дела она также смотрит, назвал ли агент конкретное отсутствующее свидетельство и соответствует ли оно официальной причине неопределённости.
Обучение уменьшило уверенность без оснований, но не решило задачу целиком
Базовая Qwen3.5-9B преувеличивала доказанность выводов в 97% ответов. После обучения на проверенных траекториях Nautil-SFT снизила эту долю до 35%, а доля одновременно правильных и аккуратно сформулированных выводов выросла с 3% до 43%.
Удаление ключевых свидетельств снижало частоту закрытия дела на 26 процентных пунктов относительно контрольного удаления. Значит, модель реагировала не только на объём файла или источник отчёта, но и на наличие оснований для конкретного вывода.
Обучение с подкреплением, где награда зависела только от правильного решения закрыть или оставить дело открытым, подняло сбалансированную точность до уровня модели-учителя. Одновременно Nautil-RLVR стала слабее реагировать на удаление доказательств. Оптимизация конечной метки улучшила совпадение с эталоном, но частично отделила вердикт от пути к нему.
Награда за качество вывода, выставленная моделью-оценщиком, дала другую поломку: агент почти перестал закрывать дела. Осторожность превратилась в универсальный отказ, который выглядит безопасно, но не выполняет задачу расследования.
Работа меняет планы команд, которые строят агентов для разбора аварий, дефектов и сбоев. Решение о завершении стоит выделить в отдельный обучаемый результат, а в набор данных включить не только правильные причины, но и обоснованные незакрытые дела с перечнем недостающих фактов.
Приёмку такого агента нельзя сводить к точности диагноза. Нужны проверки внутри источников, версии дел с удалёнными основаниями и разбор преувеличений в финальном ответе. Иначе система может правильно называть причину, но превращать вероятную гипотезу в установленный факт.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



