Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Закрытые тесты хорошо ранжируют юридические LLM, но создают ложное представление об их пригодности для работы. Препринт не прошёл рецензирование, а все числа в нём получили сами авторы: Gemini 3.1 Pro набрала 90,5% на вопросах с вариантами ответа, тогда как фактическая точность свободных ответов ни у одной модели не превысила 0,45 по шкале от нуля до единицы. Для выбора модели достаточно дешёвого теста, но выпускать её ответы без проверки юриста нельзя.
Для бенчмарка собрали 1042 вопроса по десяти областям колумбийского права: от уголовного и трудового до налогового и семейного. Вопросы разделили на три формата — с выбором ответа, с коротким свободным ответом и с разбором юридической ситуации. Студенты и юридическая команда готовили задания, затем их последовательно проверяли ассистент, профильный эксперт и комитет; 93% принятых заданий хотя бы раз исправили.
На бенчмарке проверили 15 закрытых и открытых моделей. Результаты тестов с вариантами ответа и свободных заданий почти одинаково расставили модели по местам, поэтому первый формат подходит для первичного отбора. Но он проверяет распознавание готового ответа, а не способность самостоятельно назвать норму и применить её: из процитированных моделями норм правильными оказались только 53,2%, остальные ссылались не на тот акт или на несуществующую норму.
Свободные ответы оценивали по эталонам с помощью двух моделей-оценщиков, а порядок моделей дополнительно сверили со слепой проверкой юристов. Открытая часть включала 55 задач, а каждую модель запускали без случайности, повторов и вариантов формулировки запроса. Практический шаблон бенчмарка отсюда такой: закрытые вопросы используют для дешёвого отбора, затем отдельно проверяют свободные ответы, ссылки на нормы и реальные рабочие сценарии с участием профильных экспертов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



