Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель-оценщик Jev умеет выбирать действие, когда все нужные последствия уже описаны во входе, но сбивается, если их надо сначала предсказать. Хотя работа не рецензирована и числа получили сами авторы, в 134 задачах ALFWorld внешний просмотр следующего шага поднял долю успеха с 31% до 87%. Для агента это задаёт границу архитектуры: код рассчитывает последствия, модель сравнивает готовые варианты.
Jev принимает состояние и список допустимых действий, а затем без текста рассуждений возвращает вероятность каждого варианта. Если ответ можно проверить по входным данным, модель справляется даже с неочевидным выбором. Если решение зависит от будущего состояния, поведения соперника или промежуточной цели, она чаще цепляется за слова из задания.
В ALFWorld агент получал задачу положить чистый нож в ящик. Без просмотра вперёд Jev выбирал ящик, потому что тот прямо назван в задании, хотя нож ещё следовало вымыть. Код запускал каждую команду в копии среды, добавлял полученный результат и доступный следующий шаг к описанию варианта — после этого модель выбирала раковину.
В матричных играх проявился тот же разрыв. Когда один вызов должен был предсказать ход рационального соперника и выбрать ответ, точность на вводящих в заблуждение играх составляла 33%. Если код сначала отдельно спрашивал Jev о ходе соперника, а затем передавал прогноз во второй вызов, результат вырастал до 94%.
Границу проверяли на тестах когнитивной рефлексии, одноходовых матричных играх, текстовой среде ALFWorld и управлении роботом. Во всех случаях модель лучше работала как оценщик уже рассчитанных исходов, а не как замена модели мира. Практический шаблон подходит системам, где среду можно скопировать, правила — исполнить кодом, а физику — просчитать симулятором.
Работа охватывает только Jev и одну версию его API. В ALFWorld и робототехнике код использовал точную копию среды, поэтому результаты не показывают, как схема поведёт себя при неполной или ошибочной модели мира.
Источники
Иллюстрация: рисунок из статьи «Code Owns the Simulation, Jev Owns the Evaluation», Yaodong Yang, Hongyao Tang, Yi Ma и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



