Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новый бенчмарк FinalityBench оценивает решения агентов в платёжных сбоях по деньгам, которые бизнес потерял или сохранил после действия, а не только по доле правильных решений. В работе Abhishek Sharma рейтинг подходов изменился в семи местах, хотя препринт не рецензирован, а все числа получил сам автор. Для платёжного агента это меняет критерий приёмки: верный вывод ещё не означает безопасного действия.
Бенчмарк моделирует один заказ, сведения о котором расходятся между платёжным процессором, бухгалтерским реестром, ERP и банковской выпиской. Сообщения задерживаются, дублируются, пропадают или приходят не по порядку, а агент должен отправить товар, повторить списание, вернуть деньги либо ждать. Результат считают по итоговому положению продавца с учётом реально прошедших платежей, стоимости товара, обязательств перед покупателем и расходов на спор.
Ключевая проверка строится на парных задачах. В момент решения агент видит в обеих одинаковое состояние всех систем, а проверка через авторитетный канал ещё не знает исхода платежа; позднее один платёж проходит, другой отклоняется. Поэтому раннее необратимое действие выглядит правильным в одной задаче и приносит убыток в другой.
Подход, который отправляет товар при первом положительном признаке, показал точность 65,7% и занял по ней второе место, но оказался худшим по потерям на парных задачах. Правило, которое запрещает необратимые действия до подтверждённого исхода через авторитетную проверку, достигло 85,4%. Для архитектуры агента отсюда следует практическое разделение: LLM может анализировать противоречивые данные, но право на списание, возврат или отгрузку лучше выдавать отдельному исполняемому ограничителю.
Проверка охватила 321 смоделированную задачу и девять программных политик. Каждая задача описывает один заказ с одним ожидающим списанием; задержки и экономика заданы автором как правдоподобные параметры, а не измерены в работающей платёжной системе. Поэтому FinalityBench пока проверяет прежде всего ценность авторитетного сигнала об исходе, а не способность агента самостоятельно разобраться в конфликтующих источниках.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



