Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Оценка финансового LLM-агента меняется не только из-за условий исполнения сделок: новые ответы модели и обратная связь смешивают несколько эффектов. В препринте Virginia Tech, где числа получил сам автор и рецензирования ещё не было, независимо запущенные агенты выбрали одинаковые последовательности решений лишь в 19,8% случаев. Для оценки продукта это означает, что сравнение двух запусков нельзя автоматически считать проверкой одного компонента.
Автор записал ответы моделей, а затем повторно провёл каждую последовательность через обычный и стрессовый симуляторы исполнения. Такой повтор фиксирует решения агента и отделяет механический эффект задержек, ограничений на объём сделки и проскальзывания от новых ответов модели. Стрессовый режим снизил итоговую доходность на 0,017, что равно 10,4% результата базового симулятора, но доступные запуски не позволили надёжно определить порядок моделей в рейтинге.
Отдельный эксперимент проверил LLM-аудиторов на связанных заданиях без дефектов, с одним и с двумя дефектами. Полнота — доля заданных нарушений, которые нашёл аудитор, — падала при переходе к двум дефектам в пяти из шести сочетаний аудитора и источника. Однако модель, которая чаще остальных находила оба нужных нарушения, показала точность 0,149: она сообщила о проблемах в 98 из 100 корректных заданий и выдала полностью верный набор для двух дефектов лишь в 21 из 100 случаев.
Исполнение проверяли на пяти идентификаторах моделей DeepSeek и GLM, в трёх синтетических сценариях одной короткой фазы роста. Аудит изучали на двух размещённых у провайдеров версиях моделей и синтетических траекториях с заранее внесёнными нарушениями. Поэтому работа не сравнивает торговые способности моделей: она показывает, какие контроли нужны, чтобы оценка компонента не превратилась в вывод о системе целиком.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



