Журнал · Rit.work

CertID отделяет точный ответ от причинно допустимого

CertID формально определяет, можно ли восстановить причинный эффект из наблюдений, и численно проверяет формулы reasoning-моделей вместо сравнения строк.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Появился способ проверять, не выдаёт ли reasoning-модель формулу для причинного эффекта, который нельзя восстановить из наблюдений. В препринте Arman Behnam и Binghui Wang, который не проходил рецензирование и где все числа получили сами авторы, частота таких ложных ответов различалась между моделями в 17 раз. Для систем причинного анализа обычной оценки точности недостаточно: отдельно нужны проверка допустимости ответа и проверка самой формулы.

Как CertID решает, существует ли ответ

Причинная идентификация отвечает на вопрос, можно ли вычислить эффект вмешательства только по наблюдательным данным и заданному причинному графу. Например, если лечение и исход зависят от общей неизмеренной причины, наблюдения могут не позволить отделить эффект лечения от скрытого смешения факторов.

Ошибка здесь бывает двух типов. Модель может отказаться от задачи, у которой есть решение, или уверенно предложить формулу там, где решения нет. Второй случай опаснее: никакой объём наблюдательных данных не подтвердит такую формулу, потому что разные причинные механизмы могут порождать одинаковые наблюдения, но давать разные эффекты вмешательства.

CertID строит эталонный ответ с помощью алгоритма ID. Он получает причинный граф и запрос, а затем либо выводит формулу через наблюдаемое распределение, либо находит графическое свидетельство того, что эффект не идентифицируется. Алгоритм доказанно корректен и полон для этого класса задач, поэтому метку не выбирает человек или другая LLM.

Авторы реализовали ID независимо двумя способами. Реализации не разошлись примерно на 14,9 миллиона вызовов, а также воспроизвели известные результаты для канонических причинных графов. Это проверяет программную реализацию, хотя не заменяет доказанные свойства самого алгоритма.

Почему правильной метки недостаточно

Модель может верно решить, что эффект идентифицируется, но вернуть ошибочную формулу. Сравнение с эталонной строкой здесь работает плохо: математически равные выражения часто записывают по-разному, а похожие строки могут обозначать разные величины.

CertID вместо строк подставляет формулу модели в дискретные структурные причинные модели. Для них система точно вычисляет как наблюдаемое распределение, так и настоящий эффект вмешательства. Если результаты расходятся хотя бы на одной проверке, формула опровергнута конкретным контрпримером.

Для точной арифметики авторы доказывают более сильное свойство: неверная рациональная формула почти наверняка разойдётся с истинным эффектом уже на случайно выбранной причинной модели. Реальная реализация использует численный допуск и проверяет одно значение вмешательства, поэтому эту гарантию нельзя без поправок переносить на любой производственный вычислитель.

Отдельная проверка нужна и генератору заданий. В одной из конструкций настоящие скрытые связи образовывали в графе характерные группы, поэтому классификатор мог угадывать ответ без анализа названий переменных. CertID устраняет большую часть этой подсказки: ложные связи генерируются с похожей структурой. Иначе тест измерял бы распознавание шаблона, а не причинное рассуждение.

Когда работа меняет план разработки

Gemini Flash, Gemini Pro и GPT-5.5 проверяли на 1 200 сертифицированных задачах с графами от 4 до 50 вершин. На графах, созданных после даты обучающих данных самой новой модели, решения об идентифицируемости были верны в 97–100% случаев. Значит, высокий общий результат нельзя объяснить простым запоминанием этих графов.

При этом близкая точность скрывала разный риск ложного ответа на задачу без решения. Такой риск стоит считать отдельно от общей доли правильных ответов: системе важно не только находить формулу, но и отказываться, когда наблюдательных данных принципиально недостаточно.

Для команды, которая строит помощника по причинному анализу, меняется схема приёмки. Набор тестов должен включать доказанно неидентифицируемые запросы, а отчёт — разделять верные формулы, правильные отказы, пропущенные решения и ложные утверждения. Одна итоговая точность смешивает эти исходы и маскирует наиболее дорогую ошибку.

CertID также показывает практичную архитектуру проверки: LLM предлагает решение, а детерминированный алгоритм подтверждает, что запрос вообще имеет решение; отдельный вычислитель проверяет формулу. Сам CertID авторы позиционируют как инструмент оценки, а не готовый производственный компонент, поэтому перенос потребует собственного формата графов, разбора выражений и контроля численной точности.

Работа охватывает формальную идентификацию эффектов по причинным графам и оценивает текст, который выдала модель. Она не устанавливает, отражает ли объяснение реальные внутренние вычисления модели, и не проверяет полный прикладной процесс — от построения графа по данным до выбора управленческого решения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу