Журнал · Rit.work

Аудит LLM надо проверять на чистых примерах

Парный бенчмарк показал: LLM может находить все ошибки в бэктестах, но при этом создавать десятки ложных тревог на чистом коде.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Высокая полнота, то есть доля найденных ошибок, не показывает, пригодна ли LLM для аудита бэктестов: модель может обнаружить все подстроенные дефекты и одновременно браковать чистый код. В препринте MBZUAI и University of Pittsburgh, который не проходил рецензирование и где все цифры получили сами авторы, три из четырёх моделей достигли 100% полноты, но разошлись на 79 процентных пунктов по ложным срабатываниям. Для честной оценки аудитора дефектные примеры нужно дополнять почти идентичными чистыми парами.

Бенчмарк содержит 48 пар: в каждой сохранили стратегию, даты, стиль кода, метки и структуру отчёта, а одну деталь методики сделали корректной или ошибочной. DeepSeek V4 Flash проверили на текстовых описаниях и коде с открытой инструкцией, списком возможных ошибок и предупреждением о частых чистых примерах. В последнем режиме код также проверили Gemini 2.5 Flash Lite, GPT-4.1 mini и GPT-4o mini.

Открытая инструкция заставила DeepSeek ошибочно пометить 93,8% чистых примеров кода. Список типов ошибок поднял полноту до 100%, но оставил 20,8% ложных тревог. Предупреждение о чистых примерах снизило их до нуля при той же полноте.

Один итоговый балл скрыл бы другой дефект аудита. DeepSeek всегда указывал нужные строки кода, но в шести случаях предлагал исправление не для того класса ошибки. Поэтому оценщик отдельно считает обнаружение дефекта, ложные срабатывания, точность ссылки на доказательство и уместность исправления.

Проверка охватывает синтетические парные изменения в фиксированных заготовках стратегий, а каждый аудит состоит из одного вызова модели при нулевой температуре. Бенчмарк изолирует один навык проверки и не показывает, сможет ли LLM подтвердить корректность реальной торговой системы. Как шаблон для внутренних тестов он переносится шире: чистые контрольные примеры показывают стоимость лишних проверок, которую полнота не замечает.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу