Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Jaehoon Jeong и Jay-Yoon Lee представили систему OBJECTION для прогноза решений по уголовным делам в препринте, который не проходил рецензирования. На реальных оправдательных приговорах доля ошибочных решений о виновности снизилась примерно в пять раз. Работа важна командам, которые строят юридические помощники и другие системы, где входной документ отражает позицию только одной стороны.
Что сделали
Авторы исследуют обвинительный уклон: модель принимает изложение обстоятельств из судебного документа за нейтральное описание, хотя оно может быть построено вокруг версии обвинения. Из-за этого обычная точность скрывает наиболее опасную ошибку — признание виновным человека, по делу которого вынесен оправдательный приговор.
OBJECTION работает во время формирования ответа и не требует дополнительного обучения модели. Одну LLM запускают в двух ролях: судьи и адвоката. Судья сначала оценивает дело, адвокат ищет обоснованные возражения в исходном тексте, после чего судья пересматривает вывод с учётом защиты.
Проверка встроена не после готового вердикта, а в каждый этап юридического рассуждения:
- Состав преступления: совершено ли деяние и выполнены ли необходимые объективные и субъективные признаки.
- Противоправность: исключают ли обстоятельства дела незаконность, например из-за самообороны.
- Виновность: можно ли возложить на человека личную ответственность.
Для первого этапа факты раскладываются по схеме SOAM: субъект, объект, действие и субъективная сторона. Если на одном из этапов появляется достаточное основание для оправдания, обработка завершается досрочно.
От обычного критика агент отличается поставленной задачей. Универсальный критик проверяет связность и непротиворечивость уже предложенного рассуждения. Агент-адвокат обязан построить наиболее сильную защиту, найти разумное сомнение и указать, какой фрагмент исходных обстоятельств его подтверждает. По интерпретации авторов, именно асимметрия ролей не позволяет двум экземплярам модели просто согласиться с первоначальным обвинительным выводом.
Схему проверяли с Qwen-2.5-7B-Instruct, Llama-3.1-8B-Instruct и Gemma-2-9B-it. В испытания вошли синтетические оправдательные примеры из LJPIV-CAIL и LJPIV-ELAM, а также Natural Innocent — собранный авторами набор из 3412 реальных решений южнокорейских уголовных судов.
Что показали
Основная метрика работы — доля ложных решений о виновности: какая часть фактически оправдательных дел была классифицирована как обвинительная. На Natural Innocent авторы измерили снижение этой доли с 82,93% у выбранной передовой базовой системы до 16,69% у OBJECTION.
Отдельный эксперимент показывает, что результат нельзя объяснить одним лишь структурированием рассуждения. На LJPIV-CAIL сочетание схемы фактов и последовательного юридического анализа давало 53,21% ложных решений о виновности. После добавления агента-адвоката показатель снизился до 10,71%.
Универсальная самопроверка в экспериментах авторов не обеспечила сопоставимого устойчивого эффекта. Дискуссия нескольких агентов снижала обвинительный уклон на части конфигураций, но её результат сильнее зависел от базовой модели и иногда смещался в другую сторону — к избыточным оправданиям. OBJECTION также допускала такие ошибки: уменьшение одного вида риска не означает автоматического улучшения всех решений.
Экспертная проверка аргументов сотрудниками правоохранительных органов в работе отдала специализированному агенту более высокие оценки за юридическую уместность, силу доводов, опору на факты и сходство с профессиональным заключением. Это подтверждает внутренний замысел схемы, но не заменяет проверку в реальном судебном процессе.
Ограничения
Natural Innocent состоит из решений судов Южной Кореи, а сама схема опирается на структуру уголовного права континентальной системы. Работа не показывает, сохранится ли эффект в системах общего права, других юрисдикциях, на материалах следствия или на документах, написанных иначе, чем судебные решения. Остальные два набора содержат синтетически сформированные оправдательные случаи, поэтому они не дают независимой проверки на другом корпусе естественных дел.
Авторы рассматривают только бинарный выбор между виновностью и невиновностью. Квалификацию обвинения, назначение наказания и работу с несколькими взаимосвязанными эпизодами не проверяли. Эксперименты проведены на конкретных открытых LLM сравнительно небольшого размера; перенос на другие модели нужно измерять отдельно.
Агент добавляет обращения к модели и расход токенов по сравнению с одним ответом. Авторы утверждают, что досрочное завершение делает схему экономнее полного многоагентного обсуждения, однако в основном сравнении нет денежной стоимости эксплуатации и производственных замеров под заданную задержку. Нет и сравнения с полноценным процессом, где позиции обвинения и защиты поступают из независимых документов, а не создаются одной моделью из одного текста.
Что это значит
Для команд, которые уже строят юридический помощник на однопроходном запросе к LLM, работа даёт основание пересмотреть архитектуру. Проверку спорного решения лучше формулировать не как нейтральное «найди ошибки», а как отдельную роль с заданной стороной, обязанностью ссылаться на входные факты и правом останавливать дальнейшее рассуждение.
Меняется и план испытаний. Общей точности недостаточно: отдельно нужны ошибки против оправданных и ошибки против виновных, поскольку снижение первой метрики может повысить вторую. Проверять такую схему следует на естественных документах целевой юрисдикции и на том распределении дел, которое ожидается в продукте.
Работа не обосновывает замену выбранной модели или автоматическую выдачу юридических решений. Она поддерживает более узкий инженерный вывод: если вход отражает позицию одной стороны, специализированный оппонент на каждом этапе может быть полезнее универсального критика. Для производственного решения всё ещё потребуются собственные замеры качества, стоимости, задержки и проверяемости ссылок на материалы дела.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



