Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Официальная метрика BFCL multi-turn пропускает ход, на котором агент должен запросить недостающие сведения, и тем самым поощряет действие вместо осторожности. Хотя препринт Shandong University не рецензирован и все числа получили сами авторы, новая оценка поставила gpt-5.4 на первое место среди семи моделей с точностью решения 80,7%, тогда как официальная — на шестое. При выборе модели для агента, который меняет файлы, оформляет заказы или проводит операции, рейтинг BFCL поэтому может давать неверный ориентир.
В двух категориях BFCL часть задания намеренно лишена параметра или нужной функции. Агент должен задать вопрос, но эталонная последовательность действий на этом ходу пуста, поэтому проверяющая программа его пропускает. Сценарий пользователя не отвечает на вопрос, а повторная попытка уточнить сведения может привести к провалу всего задания.
Авторы сопоставили полные задания с их версиями, где на том же ходу удалена одна деталь. На полной стороне агент должен выполнить действие, которое меняет среду, например записать файл или разместить заказ; на неполной — остановиться и спросить. Такой счётчик читает сохранённую последовательность вызовов и не использует модель-оценщик. Стратегии «всегда действовать» и «всегда спрашивать» при этом одинаково бесполезны.
Проверка охватила 223 пары, где решение действительно вело к изменению среды. Она оценивает только выбор на одном ходу, а не успешное завершение всей задачи. Авторы также исключили вручную найденные ошибочные задания и выпустили счётчик, который работает с каталогом результатов BFCL без ключа API.
Одна строка с требованием не задавать вопросов подтолкнула gpt-5.4 действовать в обеих версиях задания. Точность решения осталась в пределах погрешности, но официальный результат вырос на 13,5–23,5 пункта в проверенных категориях. Обратная инструкция для gemma-4-31B-it улучшила выбор на 4,5 пункта, однако официальный счёт не вырос. Значит, при внутренней приёмке агентных систем стоит отдельно проверять, умеет ли модель остановиться при нехватке данных, а не полагаться только на место в BFCL.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



