Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель научили считать несколько порядков независимых шагов одним корректным решением, не смешивая их с перестановками, которые ломают зависимость. VCRT показал среднюю долю успешных решений 77,60% против 64,53% у сопоставимого варианта GRPO. Хотя это нерецензированный препринт и числа получили сами авторы, результат показывает, что проверяющий модуль может оценивать не только финальный ответ, но и отношения между шагами.
Как проверка превращает последовательность в частичный порядок
Авторегрессионная модель всегда выдаёт шаги по очереди. Однако само вычисление не всегда требует именно такой очереди: независимые подзадачи доказательства можно закрыть в разном порядке, а изменения непересекающихся частей состояния — поменять местами.
Обычное обучение с проверяемой наградой считает каждую последовательность отдельной траекторией. Поэтому модель может принять случайный порядок из обучающего примера за обязательную зависимость. Простое перемешивание тоже не подходит: некоторые перестановки ставят действие раньше его предпосылки.
VCRT проверяет соседние операции обеими последовательностями. Если проверяющий модуль принимает оба варианта и они приводят к одному каноническому состоянию, перестановка получает сертификат эквивалентности. Каноническое состояние здесь означает единое представление результата, в котором несущественные различия уже устранены.
Если обратный порядок отклоняется или меняет итоговое состояние, возникает антиромб — пример настоящей зависимости. Он учит модель отделять допустимую перестановку от нарушения предпосылки.
Связанные сертифицированными перестановками траектории объединяют в одну группу. VCRT применяет обновление GRPO к их суммарной вероятности: награда относится ко всему допустимому способу вычисления, а не к одной записи. Дополнительные ограничения удерживают модель рядом с исходной стратегией, согласуют её поведение после эквивалентных перестановок и сохраняют качество на обучающих средах.
В эксперименте каждый эпизод содержал четыре операции. Авторы перебирали все 24 порядка, из которых ровно 12 входили в сертифицированную группу. Поэтому суммарную вероятность удалось вычислить точно, без приближённой выборки.
Запрет неверных перестановок оказался важнее общей массы верных
VCRT сравнивали с Canonical-GRPO, который получал тот же анонимный граф отношений, но обучался по отдельным траекториям. Это отделяет эффект представления от эффекта нового составного критерия обучения.
Основной прирост сосредоточился в Lean: доля успешных решений выросла на 33,49 процентного пункта. В ProofWriter и CLRS средний прирост составил 2,85 пункта. Две из девяти комбинаций среды и запуска дали отрицательный результат, поэтому эффект нельзя считать одинаковым для каждой задачи.
Разбор компонентов уточняет вывод. Без антиромбов VCRT работал хуже во всех удержанных средах: обучение действительно выигрывает, когда модель явно видит перестановки, нарушающие зависимости. Удаление объединённой вероятности сертифицированных траекторий, напротив, не дало статистически различимого ухудшения.
Работа поэтому не доказывает, что награду обязательно нужно переносить на точную сумму вероятностей всех допустимых порядков. Она надёжнее поддерживает более узкую идею: проверяющий модуль должен размечать не только успех, но и границу между независимостью шагов и обязательным предшествованием.
Когда VCRT меняет планы команды
Подход применим там, где уже есть детерминированный проверяющий модуль и операции можно повторно выполнить из сохранённого состояния. Для новой среды понадобится адаптер, который запускает два локальных порядка, сопоставляет операции и сравнивает конечные состояния. Модель при этом может получать общий анонимный граф, а внутреннее состояние предметной системы остаётся внутри адаптера.
Если такая инфраструктура уже существует, в план обучения стоит добавить отрицательные примеры перестановок: они получили самую устойчивую экспериментальную поддержку. Перестраивать весь алгоритм ради точного объединения вероятностей пока рано. На длинных траекториях полный перебор порядков станет непрактичным, а работа не проверяет приближённый расчёт.
Границы эксперимента узкие: использовались компактные Qwen3.5-2B и Granite-4.1-3B, структурированные задачи ProofWriter, CLRS и Lean и заранее подготовленный граф отношений. Модель не извлекала зависимости из свободного текста. На тесте она выдавала одну жадно выбранную траекторию без поиска, повторных попыток и обратной связи от проверяющего модуля, поэтому прирост относится именно к обученной стратегии.
Для доказательств, алгоритмических сред и формализованных бизнес-правил работа предлагает практическую границу архитектуры: предметная система сертифицирует отношения между действиями, а общий обучающий слой использует их без доступа к внутренним данным среды. Для агентов, которые должны сами восстановить зависимости из неструктурированного ввода, эти результаты пока не меняют план разработки.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



