Журнал · Rit.work

Legal Research Bench отделил правдоподобный юридический ответ от полного

Новый тест показал, как юридические ИИ-агенты пропускают обязательные выводы и источники, даже когда основная часть ответа верна.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Даже лучшие ИИ-агенты пока не могут надёжно провести юридическое исследование от поиска норм до итогового вывода. В препринте Vals AI, который не прошёл рецензирование и содержит замеры самих авторов, Claude Opus 4.8 полностью справился с 42,9% заданий. Для продукта это означает, что доступ к поиску и базе судебных решений не заменяет проверку результата юристом.

Legal Research Bench включает 413 открытых вопросов по праву США. Практикующие юристы подготовили для каждого эталонный ответ, обязательные критерии и список подтверждающих источников. Ответ засчитывали, только если агент выполнил все критерии, сделал верный правовой вывод и сослался на действующие документы по корректным адресам.

В тесте участвовали 13 моделей с доступом к веб-поиску, CourtListener, загрузке страниц и поиску по уже найденным документам. Модель-оценщик GPT-5.4 проверяла ответы по критериям; перед этим её решения сверили с оценками практикующих юристов.

Частичная правильность маскирует риск. Claude Opus 4.8 набрал 85,4% по отдельным критериям, но полностью прошёл меньше половины заданий. На 29,5% вопросов модели пропустили хотя бы один ключевой критерий, включая нужную норму, обязательный прецедент или центральный правовой вывод. Задания, где требовалось согласовать несколько или противоречащих друг другу источников, проходили в 20,4% случаев против 29,9% для остальных.

Инструменты необходимы: без них результат в среднем падал на 22,5 процентного пункта. При этом больше поисковых запросов, шагов агента и затрат не давали более точного ответа. При проектировании такого продукта важнее отдельно проверять полноту вывода и каждую ссылку, чем просто увеличивать число циклов поиска.

Тест охватывает англоязычное право США и вопросы с достаточно однозначным ответом. Модели запускали по одному разу на задание в фиксированном наборе инструментов, поэтому результаты описывают этот контур, а не юридическую работу во всех юрисдикциях.

Источники

Иллюстрация: рисунок из статьи «Legal Research Bench: Measuring End-to-End Reliability in Long-Horizon Legal Research Agents», Katrina Drozdov, Oliver Chen, Langston Nashold и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу