Журнал · Rit.work

Проверяемые кодовые миры дают LLM точные данные для обучения

Программируемые симуляторы создают траектории без ручной разметки и помогают небольшим LLM переносить правила на незнакомые задачи.

Rit.work
Студия разработки
10 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковые модели научили переносить правила на незнакомые задачи с помощью искусственно созданного опыта. Хотя препринт James Schwoebel и его коллег не рецензирован и числа получили сами авторы, небольшая модель после такого обучения прибавила 29 процентных пунктов при размере 0,5B. Если поведение предметной области можно описать программой, команда получает источник размеченных данных без ручного разбора каждого примера.

Как код превращает правила в размеченный опыт

Команда задаёт состояние системы, доступные действия, правила перехода и условия, которые нельзя нарушать. Состоянием может быть запись с остатками товара, очередями, ценами, позициями или флагами, а переход описывает, что изменится после конкретного действия.

LLM пишет по этому описанию исполняемую функцию. OpenWorld принимает её, только если код имеет нужную сигнатуру, запускается в песочнице, сохраняет заданные условия на проверочных примерах и при необходимости проходит критику второй модели.

Получившийся кодовый мир можно запускать многократно. Каждый запуск создаёт траекторию — последовательность состояний, действий и правильных следующих состояний. Эти пары становятся данными для дообучения: метку вычисляет программа, поэтому не нужно просить другую LLM угадать ответ или привлекать человека к разметке.

Точность здесь означает соответствие записанным правилам, а не реальному процессу. Проверка подтверждает, что программа исполняется, не нарушает условия и отвечает на подготовленные пробы. Если сама спецификация неверна или проверочные случаи не покрывают важную ветку, симулятор будет уверенно учить модель неправильному поведению.

Исследователи называют обучение на множестве таких симуляторов вычислениями на множестве миров. В отличие от обычного случайного изменения параметров одного симулятора, каждый мир отдельно создают и проверяют. Модель видит разные реализации общей структуры, а затем решает задачи из миров, которых не было в обучении.

Точность переходов важнее разнообразия

В эталонных симуляторах проверяемый код сохранял точное состояние на всём пути из 20 переходов. Пошаговый предсказатель на LLM в среднем впервые ошибался уже на шаге 2,3, после чего следующие состояния строились на неверной основе. Код не устраняет ошибку в правилах, но не добавляет новую ошибку при каждом переходе.

На синтетических семействах больше всего выиграли небольшие модели. По мере роста модели прибавка сокращалась и у крупнейшей конфигурации оказалась в пределах погрешности: исходная способность уже приблизилась к насыщению.

Более содержательный результат получен на List Functions. Один адаптер обучили на 128 отдельных мирах, после чего он достиг 40% точности на новых мирах против 6% у контрольной версии с намеренно испорченными метками. Разрыв статистически значим: само разнообразие задач не помогло, если траектории описывали неверные переходы.

На ARC-AGI и CLRS тот же приём проверяли как обучение внутри отдельного мира, но результаты были слабее и менее устойчивы. Перенос между разными задачами тоже оказался ограниченным: он появляется, когда задачи требуют общего навыка, а не просто принадлежат к одной широкой теме.

Когда кодовые миры стоит включить в план

Работа не предлагает заменить ими все обучающие данные. Подход подходит процессам, где команда может явно записать состояние и правила: управлению запасами, расписаниям, очередям, переговорам, расчётам по известным формулам и ремонту программ. Он особенно полезен, когда реальные размеченные случаи редки, но правила уже существуют в регламентах или коде.

Практический прототип потребует сначала формализовать действия и условия, затем проверить сгенерированный переход на граничных ветках. После этого можно создать семейство различающихся миров, собрать траектории, дообучить модель и отдельно измерить перенос на мирах, которые она не видела. Контроль с испорченными метками поможет понять, дала ли эффект точность симулятора или обычное увеличение набора.

Проверки охватывали символические семейства миров, List Functions, ARC-AGI, CLRS и небольшой набор задач ремонта программ. Монолитная генерация с моделью 7B становилась ненадёжной примерно после восьми взаимодействующих правил, поэтому сложные процессы придётся делить на компоненты. Дообучение запускали на одном A100, а часть результатов по масштабу моделей и реальным наборам получила лишь один запуск, поэтому форму зависимости пока стоит считать ориентиром.

Пиксели, видео и неформализованные физические процессы остаются за пределами метода. Если символическое состояние извлекает отдельная система восприятия, ошибка может возникнуть ещё до запуска точного перехода. Сгенерированный код также нужно исполнять в полноценной изоляции: песочница эксперимента рассчитана на случайные сбои, а не на противодействие вредоносной программе.

Для продуктовой команды работа меняет не выбор основной LLM, а план подготовки данных. До покупки ручной разметки имеет смысл проверить, можно ли выразить часть предметной логики исполняемыми правилами. Если это удаётся, кодовый мир становится проверяемым генератором примеров; если правила расплывчаты или зависят от восприятия, преимущество исчезает.

Источники

Иллюстрация: рисунок из статьи «World-Time Compute with Verified Code World Models», James Schwoebel, Ingrida Semenec, Jenia Rousseva и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу