Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Нулевая доля успешных попыток в агентном бенчмарке не доказывает, что задача действительно трудна. Из 125 таких задач в Terminal-Bench 3 только 78 выдержали дополнительную проверку, хотя препринт не рецензирован и все числа получили сами авторы. При выборе модели нулевой результат стоит учитывать лишь вместе с данными о среде, эталонном решении и проверяющей программе.
Для аудита использовали замороженный архив разработки Terminal-Bench 3, также названного Frontier-Bench 0.1. В него вошли 639 оценённых задач и 28 801 запуск: обычные попытки агентов, прогоны эталонных решений, пустые ответы, попытки обойти проверку, журналы выполнения и обсуждения рецензентов.
Каждую задачу без успешной обычной попытки проверяли по порядку. Сначала выясняли, принимает ли проверяющая программа эталонное решение. Затем отделяли сбои инфраструктуры, искали подтверждённый обход проверки и оценивали, достаточно ли свидетельств, что у задачи вообще есть рабочий путь решения.
После этого одинаковый ноль распался на разные случаи. Часть задач не принимала эталонное решение, в других преобладали сбои среды, некоторые проходились только через обход проверки, а для остальных не удалось подтвердить решаемость. Такие результаты требуют разных действий: исправить задачу, исключить её из сравнения или оставить статус неопределённым.
Даже 78 прошедших аудит задач нельзя считать доказанно трудными при любых условиях. Метка означает лишь, что в зафиксированной среде сработал авторский путь, инфраструктура не объяснила большинство сбоев, явного обхода не нашли, а проверенные агенты не справились. У большинства из них эталон запускали только один раз, поэтому аудит подтверждает корректность измерения слабее, чем повторные прогоны или независимое решение.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



