Журнал · Rit.work

Сломанный тест выглядит таким же трудным, как нерешённая задача

Аудит Terminal-Bench показал, почему нулевая доля успешных попыток может говорить о сбое среды или проверки, а не о пределах модели.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Нулевая доля успешных попыток в агентном бенчмарке не доказывает, что задача действительно трудна. Из 125 таких задач в Terminal-Bench 3 только 78 выдержали дополнительную проверку, хотя препринт не рецензирован и все числа получили сами авторы. При выборе модели нулевой результат стоит учитывать лишь вместе с данными о среде, эталонном решении и проверяющей программе.

Для аудита использовали замороженный архив разработки Terminal-Bench 3, также названного Frontier-Bench 0.1. В него вошли 639 оценённых задач и 28 801 запуск: обычные попытки агентов, прогоны эталонных решений, пустые ответы, попытки обойти проверку, журналы выполнения и обсуждения рецензентов.

Каждую задачу без успешной обычной попытки проверяли по порядку. Сначала выясняли, принимает ли проверяющая программа эталонное решение. Затем отделяли сбои инфраструктуры, искали подтверждённый обход проверки и оценивали, достаточно ли свидетельств, что у задачи вообще есть рабочий путь решения.

После этого одинаковый ноль распался на разные случаи. Часть задач не принимала эталонное решение, в других преобладали сбои среды, некоторые проходились только через обход проверки, а для остальных не удалось подтвердить решаемость. Такие результаты требуют разных действий: исправить задачу, исключить её из сравнения или оставить статус неопределённым.

Даже 78 прошедших аудит задач нельзя считать доказанно трудными при любых условиях. Метка означает лишь, что в зафиксированной среде сработал авторский путь, инфраструктура не объяснила большинство сбоев, явного обхода не нашли, а проверенные агенты не справились. У большинства из них эталон запускали только один раз, поэтому аудит подтверждает корректность измерения слабее, чем повторные прогоны или независимое решение.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу