Журнал · Rit.work

Оценка LLM-агента требует фиксировать ответы и считать ложные срабатывания

Фиксированные ответы отделяют влияние симулятора от поведения LLM-агента, а тесты без дефектов показывают, когда высокая полнота аудитора вводит в заблуждение.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Оценка финансового LLM-агента меняется не только из-за условий исполнения сделок: новые ответы модели и обратная связь смешивают несколько эффектов. В препринте Virginia Tech, где числа получил сам автор и рецензирования ещё не было, независимо запущенные агенты выбрали одинаковые последовательности решений лишь в 19,8% случаев. Для оценки продукта это означает, что сравнение двух запусков нельзя автоматически считать проверкой одного компонента.

Автор записал ответы моделей, а затем повторно провёл каждую последовательность через обычный и стрессовый симуляторы исполнения. Такой повтор фиксирует решения агента и отделяет механический эффект задержек, ограничений на объём сделки и проскальзывания от новых ответов модели. Стрессовый режим снизил итоговую доходность на 0,017, что равно 10,4% результата базового симулятора, но доступные запуски не позволили надёжно определить порядок моделей в рейтинге.

Отдельный эксперимент проверил LLM-аудиторов на связанных заданиях без дефектов, с одним и с двумя дефектами. Полнота — доля заданных нарушений, которые нашёл аудитор, — падала при переходе к двум дефектам в пяти из шести сочетаний аудитора и источника. Однако модель, которая чаще остальных находила оба нужных нарушения, показала точность 0,149: она сообщила о проблемах в 98 из 100 корректных заданий и выдала полностью верный набор для двух дефектов лишь в 21 из 100 случаев.

Исполнение проверяли на пяти идентификаторах моделей DeepSeek и GLM, в трёх синтетических сценариях одной короткой фазы роста. Аудит изучали на двух размещённых у провайдеров версиях моделей и синтетических траекториях с заранее внесёнными нарушениями. Поэтому работа не сравнивает торговые способности моделей: она показывает, какие контроли нужны, чтобы оценка компонента не превратилась в вывод о системе целиком.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу