Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Появился протокол, который отделяет полезный результат ИИ-агента от результата, доступного без истории его экспериментов. Jingjie Ning, Shanshan Zhong, Xiaochuan Li и Ji Zeng проверили его на двух контрольных задачах: сопоставимые агенты не повторили целевой результат ни в одном из 96 запусков на задачу, хотя работа не рецензирована и числа получили её авторы. Для команд это превращает заявление «агент сделал открытие» в заранее спроектированный аудит, а не в вывод из высокого балла.
Протокол разделяет полезность, воспроизведение и обратную связь
Discovery Certification Protocol, или DCP, начинает с точного описания результата. До запуска команда фиксирует задачу, модель, исходные сведения, инструменты, бюджет, правила выбора итогового решения и численный порог успеха. Итоговый артефакт затем проверяет закрытый оценщик, который не участвовал в поиске решения.
Этот этап подтверждает только полезность. Программа может ускорять запросы, а рецепт — давать лучший результат, но высокий балл ещё не показывает, понадобилась ли агенту собственная цепочка экспериментов. Он мог собрать известные компоненты, использовать сведения из общедоступных страниц или прийти к тому же решению другим путём.
Следующий этап запускает сопоставимого агента с той же моделью, инструментами, исходными данными и бюджетом. Ему передают даже точные страницы, которые видел исходный агент, но скрывают гипотезы, промежуточные результаты, оценки кандидатов и другие сведения, появившиеся по ходу целевого запуска.
Засчитывается любой допустимый способ достичь установленного порога. Если контрольный агент находит другое решение с тем же качеством, оно становится свидетельством воспроизведения и закрывает путь к решению Core. Поэтому протокол проверяет не сходство рассуждений или кода, а доступность самого результата в заданной информационной среде.
Одного отсутствия совпадений недостаточно. DCP требует заранее определить число попыток, проверить работоспособность контрольных агентов на известных задачах и рассчитать верхнюю границу вероятности успеха в новом запуске. Слабые контрольные проверки или нарушенные журналы дают незавершённый аудит, а не положительный сертификат.
Необязательный этап отделяет влияние экспериментальной обратной связи. Свежие ветки стартуют из одной сохранённой точки: одна получает правдивые результаты своих действий, другая — сообщения той же формы и длины, но без подсказки о следующем шаге. Если правдивая ветка выигрывает, а отдельная проверка показывает, что нейтральные сообщения сами не меняют результат, DCP присваивает решение Evidence.
Нулевое воспроизведение ещё не означает абсолютную новизну
Полный протокол проверили на оптимизации индексов SQLite и управлении виртуальной каталитической реакцией. В первой задаче DeepSeek-v4-flash выбрал индексы, которые сократили взвешенное число операций виртуальной машины SQLite на 88,55%. Во второй DeepSeek-v4-pro нашёл оптимальный рецепт в закрытой детерминированной среде.
При нулевом результате контрольных серий верхняя граница вероятности воспроизведения в одном новом запуске составила 4,68%. В парных испытаниях правдивую обратную связь получили все успешные ветки, тогда как нейтральные ветки не достигли цели. Отдельные проверки нейтрального канала уложились в заранее установленный диапазон эквивалентности.
Другой контрольный пример показал, зачем нужен запрет при первом найденном альтернативном пути: агент решил задачу о рюкзаке иначе и превысил целевой порог, поэтому Core не прошёл. Ещё один намеренно недособранный аудит получил статус незавершённого, а не положительный или отрицательный вывод.
Проверки охватывают две искусственно контролируемые задачи и две конкретные модели DeepSeek. Решение DCP действует только для зарегистрированных модели, бюджета, исходной информации, доступных веб-страниц и оценщика. Core не доказывает историческую новизну результата и не утверждает, что утечка невозможна: он ограничивает вероятность воспроизведения внутри описанной процедуры.
Командам придётся проектировать аудит до запуска агента
DCP меняет планы там, где продукт должен обосновать исследовательский вклад, а не просто показать хороший итоговый показатель. Команде понадобится заранее отделить исходные данные от истории экспериментов, закрыть итоговую проверку, записывать точные ответы веб-источников и инструментов, сохранять контрольные точки и привязать каждую попытку к неизменяемому журналу.
Это заметная инфраструктурная нагрузка. Два полных аудита потребовали 435 и 507 записанных сессий и стоили 56,40 и 61,17 доллара соответственно. Эти суммы относятся к контролируемым задачам работы и не служат оценкой стоимости аудита для лабораторной или производственной системы, но показывают, что основная цена возникает при генерации независимых запусков.
После сбора доказательств решение пересчитывает детерминированная программа без LLM. Это позволяет аудитору повторить проверку по замороженному пакету, не оплачивая новые вызовы модели. Однако такой повтор подтверждает только целостность расчёта; происхождение журналов и соблюдение условий должен отдельно удостоверить независимый участник.
Если системе нужен лишь лучший код, конфигурация или рецепт, DCP не заменяет обычную закрытую оценку качества. Он нужен для более узкого заявления: агент получил результат благодаря собственной исследовательской траектории, а сопоставимый агент без неё не смог сделать то же самое в заданных условиях.
Добавить эту проверку после публикации результата можно лишь частично. Повторный аудит покажет, насколько результат доступен сейчас, когда он уже мог попасть в документы, модели и поисковые индексы. Поэтому команды, которым важен статус Core или Evidence, должны заложить регистрацию, разделение информации и контрольные запуски в архитектуру эксперимента до первого действия агента.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



