Журнал · Rit.work

Arbitr проверяет понимание LLM через логические противоречия

Arbitr наказывает LLM за несовместимые вероятности логически связанных утверждений, но не решает проблему фактических ошибок и требует настройки под размер модели.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научили реже противоречить собственным вероятностным оценкам, когда один факт спрашивают в разных формулировках или связывают с отрицанием. В нерецензированном препринте Daniel Dragonevskiy, где числа получил сам автор, обучение Arbitr снизило логическую несогласованность без потери точности на целевых задачах. Для продуктов, которые показывают уверенность модели или принимают по ней автоматические решения, это добавляет отдельную проверку поверх правильности ответа.

Когда противоречие превращается в гарантированную прибыль

Работа предлагает измерять одну узкую составляющую понимания: согласует ли модель вероятности логически связанных утверждений. Если модель оценивает утверждение по-разному из-за формата вопроса либо назначает несовместимые вероятности утверждению и его отрицанию, условный трейдер может составить набор ставок, который принесёт прибыль при любом допустимом исходе.

Такая прибыль и служит мерой несогласованности. Нулевая прибыль означает, что оценки можно свести к единому распределению вероятностей по логически допустимым вариантам мира. Чем больше гарантированный выигрыш, тем дальше ответы модели находятся от этой области согласованных вероятностей.

Проверить все связи между произвольным числом утверждений вычислительно трудно. Поэтому трейдера ограничивают: он может строить ставки только на небольшом наборе утверждений и использовать заданные правила — например, отрицание, равенство цен для двух формулировок или логический вывод из нескольких посылок. Получается не бинарная отметка «понимает или нет», а уровень: какие по сложности противоречия модель уже не допускает.

Отдельная теорема показывает, почему обычное предсказание следующего токена не гарантирует такой согласованности. Если два автора придерживаются противоположных взглядов, а стиль текста выдаёт автора, оптимальная модель назначит одному утверждению разные вероятности в разных стилях. Для имитации корпуса это верно, но в продукте формат вопроса часто не должен менять оценку факта. Простое увеличение модели не устраняет это расхождение целей.

Arbitr добавляет противника и удерживает модель от пустого ответа

Arbitr обучает две сети. Основная модель назначает вероятности утверждениям, а небольшая сеть-трейдер ищет сочетание ставок с гарантированной прибылью. Найденная прибыль становится штрафом для основной модели, поэтому ей приходится согласовывать ответы между форматами и логическими конструкциями.

Одного штрафа недостаточно. Модель может избежать большинства ставок, если всегда выражает одинаковую неопределённость. В раннем варианте Arbitr несогласованность сократилась на два порядка, но часть запусков пришла именно к такому малоинформативному состоянию. Калибровочный якорь, который сохраняет связь вероятностей с правильными ответами, убрал этот сценарий.

До обучения модели позволяли извлекать до 0,15 гарантированной прибыли на единицу ставки. На Phi-3.5 обучение сократило несогласованность отрицаний в 2,9 раза, а расхождения между форматами — в 2 раза. На новой формулировке отрицания обученная модель превзошла контрольную в 24,3 раза, хотя часть зависимости от конкретных слов сохранилась.

Метод проверяли в серии заранее спланированных экспериментов на Qwen2.5 и Phi-3.5, преимущественно через адаптеры для моделей от 1,5 до 7 млрд параметров. Использовали синтетические логические конструкции, отрицания и несколько форматов вопросов; критерии записали до запусков, но не размещали во внешнем реестре. Перенос на свободный текст в работе не проверяли.

Командам нужен новый тест, а не смена архитектуры

Работа не даёт основания заменять выбранную LLM или переписывать генерацию. Arbitr меняет обучение вероятностных оценок, но текст по-прежнему создаёт авторегрессионный декодер. Практическое следствие уже: если система использует уверенность модели для маршрутизации запросов, отказа от ответа или запуска действия, одной калибровки на независимых вопросах недостаточно.

В набор проверок стоит добавить логически связанные запросы: исходное утверждение, отрицание, перефразирование и вывод из нескольких посылок. Разница между ответами превращается в измеримую уязвимость, которую можно отслеживать между версиями модели. При наличии обучающих данных тот же тест становится штрафом во время дообучения.

У меры есть жёсткая граница. Логически согласованная модель может последовательно поддерживать ложный факт, поэтому Arbitr не исправляет фактические галлюцинации и не связывает ответы с внешним миром. Источники знаний, поиск по документам и проверка фактов остаются отдельными слоями системы.

Масштаб также создаёт ложный сигнал: у крупнейшей проверенной Qwen почти нулевая измеренная несогласованность иногда соседствовала с необоснованно высокой уверенностью. Параметры обучения, подобранные для меньшей модели, пришлось менять при переходе к большей. Поэтому низкую арбитражную уязвимость следует оценивать вместе с калибровкой, точностью и долей вопросов, на которые модель решается ответить.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу