Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Промежуточные решения LLM-агента научились оценивать до того, как становится виден итог долгой задачи. Команда Wenbo Pan собрала Taste-Bench; хотя работа не рецензирована и числа получили сами авторы, лучший результат на тесте составил лишь 59,7%. Для разработки агентов это переносит внимание с финального ответа на развилки, после которых ошибка может проявиться через десятки следующих действий.
Как траектория превращается в вопрос о выборе
Авторы называют «вкусом» способность выбрать направление, которое даст лучший результат позднее. Например, агент может продолжить текущую реализацию или переписать её основу: оба варианта выглядят разумно сейчас, но один упростит дальнейшие изменения, а другой приведёт к тупику.
Один итоговый балл не позволяет отделить качество решения от качества исполнения. Агент мог выбрать верный подход, но плохо написать код, столкнуться с ошибкой среды или потратить бюджет на второстепенную проверку. Поэтому Taste-Bench ищет развилки, где можно сопоставить два направления при одинаковом или близком исходном состоянии.
Первый источник развилок — параллельные попытки решить одну задачу. Система выравнивает их до общего префикса, находит место расхождения и сравнивает дальнейшие результаты. Вариант, после которого тесты проходят или эксперимент достигает цели, получает метку лучшего.
Второй источник — обходные пути внутри одной попытки. Агент выбирает направление, сталкивается с неудачей, отказывается от него и позднее завершает задачу другим способом. Заброшенный и успешный варианты образуют пару, а вопрос ставится в точке до первой ошибки: сможет ли другая модель заранее распознать тупик.
Из таких записей получился набор из 502 вопросов по разработке программ и исследованиям в машинном обучении. В каждом вопросе модели показывают задачу, историю до развилки и два нейтрально сформулированных направления, но скрывают продолжение. Фильтры удаляют примеры, где ответ выдаёт формулировка или где итог траектории не подтверждает метку однозначно.
Поздние последствия модели почти не предсказывают
Один вопрос предъявляют дважды, меняя варианты местами. Ответ засчитывают, только если модель оба раза выбирает одно и то же верное направление. Такой протокол отсекает предпочтение первой или второй позиции, а случайное угадывание даёт 25%.
Лучшие модели не приблизились к надёжному выбору. GPT-5.6 Sol набрал 59,7%, а остальные семейства распределились ниже. Особенно плохо модели справлялись с обходными путями, где требуется заметить будущую проблему раньше агента, который действительно выполнял задачу.
Чем позже появлялось решающее свидетельство, тем сильнее падала точность. Средний результат моделей снизился с 62,3% для развилок, где подсказка уже содержалась в истории, до 21,0% для решений, которые требовали выполнить дополнительную работу. Последний результат оказался около уровня случайного выбора.
Увеличенный бюджет рассуждений не исправил картину. Модели тратили больше токенов именно на трудные развилки, но не выбирали лучше. Значит, проблема не сводится к короткому внутреннему рассуждению: агенту не хватает способности предсказать последствия действий без фактического продолжения работы.
Планы меняются, если команда уже сохраняет несколько попыток
Работа предлагает практический цикл обучения без ручной разметки каждого шага. Модель-учитель видит правильное направление и объясняет выбор, после чего модель-ученик обучается воспроизводить это решение без доступа к будущему результату. На задачах, которых не было в обучающей части, преимущество ученика над исходной моделью составило 17,9 процентного пункта.
Затем ученик выступил советником для фиксированного агента Qwen3.6-27B. Его рекомендации заранее добавляли в контекст задачи: какую ветку избегать и какую выбрать в соответствующей ситуации. На 41 отложенной задаче SWE-bench Pro доля успеха выросла с 14,6% без советов до 33,7% с советами ученика.
Этот результат поддерживает отдельный модуль, который оценивает ключевые решения, а не заменяет исполняющего агента. Команда может собирать несколько прогонов, извлекать расхождения, обучать на них советника и проверять, повышает ли он итоговый успех на новых запусках.
Граница метода проходит по доступным траекториям. Taste-Bench проверяли на программной разработке и исследованиях в машинном обучении, а советы для итогового эксперимента извлекали из прежних прогонов тех же отложенных задач. Работа поэтому обосновывает обучение на накопленных попытках, но не показывает универсального советника, который без такой истории находит развилки в любой новой задаче.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



