Журнал · Rit.work

Schema хранит правила неизвестной среды в исполняемой программе

Schema превращает наблюдения LLM-агента в проверяемую программу среды и помогает планировать длинные последовательности действий без дообучения модели.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM-агента научили осваивать неизвестные игровые среды, правила и цели которых заранее не заданы. Команда Impossible Research, UC Berkeley и Carnegie Mellon представила Schema: на ARC-AGI-3 оболочка подняла относительную эффективность действий — метрику завершения уровней с поправкой на число ходов человека — с 58,7% до 99,2%, хотя препринт не прошёл рецензирование и все числа получили сами авторы. Для долгоживущих агентов работа предлагает архитектуру памяти, проверки гипотез и планирования без дообучения базовой модели.

Текстовые заметки заменяет исполняемая модель среды

Обычный агент записывает открытия в контекст или редактируемую память: например, «ключ меняет цвет после контакта с объектом». Такие записи трудно проверить автоматически. При сжатии контекста агент может потерять условие, смешать старое правило с новым или продолжить действовать по опровергнутой гипотезе.

Schema заставляет агента выражать текущее понимание среды как программу. Она хранит структурированное состояние объектов и правила перехода: какое наблюдение должно появиться после конкретного действия. Программа лежит в постоянной рабочей области и сохраняется между обращениями к модели.

Рабочий цикл состоит из четырёх операций. Сначала агент формулирует гипотезу и записывает её в коде. Затем оболочка заново проигрывает накопленную историю и показывает переходы, для которых прогноз программы не совпал с фактическим результатом.

После проверки программа работает как локальный симулятор. Агент задаёт цель и ищет последовательность действий внутри модели среды, не расходуя реальные ходы. Он может выбрать поиск в ширину, A* или собственную процедуру, а также ограничить глубину и время поиска.

Готовый план исполняется по одному действию. Перед каждым шагом программа предсказывает следующее наблюдение; при первом расхождении оболочка отменяет остаток последовательности и возвращает новый факт агенту. Поэтому ошибка превращается в материал для следующей версии модели, а не распространяется на весь план.

Проверка истории помогает не забывать найденные правила

Подход проверяли в трёх игровых средах. ARC-AGI-3 требует понять управление и цель по цветным сеткам, DiG-bench скрывает правила текстовых игр, а MazeBench проверяет, сохраняет ли агент знания на протяжении десятков тысяч взаимодействий. Внутри каждого испытания Schema сравнивали с другими оболочками на той же базовой модели.

В DiG-bench агент выиграл все 21 публичную игру. В MazeBench он достиг медианного результата сильных игроков и переносил однажды найденные правила между комнатами. Тем самым испытания охватывают как короткое выяснение скрытого механизма, так и длительное исследование большой среды.

Разбор компонентов показывает, что результата не даёт один лишь запуск кода. На подмножестве самых трудных игр полная система получила 72,9% относительной эффективности, а после удаления любого из ключевых механизмов результат не превышал 62,3%. В одном из эпизодов вариант без пошаговой проверки продолжил выполнять ошибочный план ещё 42 действия после того, как одноразовая станция исчезла вопреки прогнозу.

Работа подтверждает вывод для дискретных игровых сред, где доступны конечный набор действий, наблюдаемое состояние и однозначная обратная связь. Это содержательная проверка архитектуры агента, но не прямой замер на браузере, корпоративном API или физическом оборудовании.

Когда Schema меняет план разработки агента

Работа меняет архитектурный выбор для продуктов, где агент долго исследует систему с неизвестными или меняющимися правилами. В таком случае контекст модели стоит считать журналом рассуждений, а не единственным хранилищем знаний. Устойчивое представление среды лучше вынести в отдельную программу с явным состоянием и переходами.

Практический прототип можно собрать из тех же частей:

  • Постоянная модель. Агент редактирует код, который описывает объекты, состояние и последствия действий.
  • Журнал переходов. Каждое действие сохраняется вместе с состоянием до него, прогнозом и полученным результатом.
  • Повторная проверка. После изменения кода система прогоняет всю историю, чтобы новое правило не сломало уже объяснённые случаи.
  • Безопасное исполнение. Длинный план идёт дальше только пока наблюдения совпадают с прогнозом.

Такой слой особенно уместен, если ошибки дороги, контекст приходится сжимать, а знание нужно переносить между сессиями. Он также позволяет разделить две причины сбоя: модель либо неверно поняла устройство среды, либо построила плохой маршрут внутри правильной модели.

Для процесса с заранее известными API и фиксированными правилами вся схема может оказаться лишней: достаточно обычного планировщика и строгой проверки вызовов. Но если продукт должен учиться через действия, работа предлагает сначала улучшить оболочку и представление знаний, а уже затем рассматривать дообучение LLM.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу