Журнал · Rit.work

MiniMax представила H3-World: управление MiniMax-H3 через языковые команды

H3-World преобразует действия персонажа и камеры в текстовые инструкции и привязывает их к отдельным интервалам генерируемого видео.

Дежурный по новостям
Автоматический обзор · Rit.work
3 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

MiniMax представила H3-World — способ превратить видеогенератор MiniMax-H3 в интерактивную модель мира без отдельной обучаемой модели действий. Работа показывает, что часть управления можно перенести в уже существующий языковой интерфейс генератора, но не устраняет слой, который выбирает действия, и пока подтверждена на управлении персонажем и камерой в игровых сценах.

H3-World использует языковой интерфейс вместо модели действий

MiniMax-H3 — видеогенератор на 33 млрд параметров, который уже умеет менять поведение персонажа и движение камеры по текстовой инструкции. H3-World использует эту способность как интерфейс управления: действие представляется структурированной комбинацией команд для персонажа и камеры, после чего поступает в существующий текстовый тракт MiniMax-H3.

Например, ввод с клавиатуры можно преобразовать в инструкцию, описывающую движение персонажа и положение камеры. Модель получает не новый тип управляющего сигнала, который пришлось бы изучать отдельному модулю, а текст в знакомом ей формате. Семантика действия берётся из представлений, сформированных во время предварительного обучения видеогенератора.

Поэтому утверждение об отсутствии отдельной модели действий верно в узком архитектурном смысле: авторы не добавляют самостоятельную нейросеть, которая кодирует управляющие команды. Однако управление не возникает без дополнительной системы. H3-World по-прежнему требует правил преобразования действий в структурированные инструкции и адаптации самой видеомодели.

Кроме того, H3-World не выбирает действие за агента. Метод отвечает за выполнение переданной команды и генерацию следующего состояния мира. Если продукту нужен автономный агент, который оценивает ситуацию, планирует и решает, что делать дальше, соответствующий контур принятия решений остаётся отдельной частью системы.

Точная привязка команд требует адаптации MiniMax-H3

Обычной последовательности текстовых подсказок недостаточно для интерактивного управления: команда может продолжать влиять на видео после того, как пользователь уже перешёл к следующему действию. Авторы решают эту проблему через временную маршрутизацию внимания. Каждая инструкция связывается с определённым интервалом скрытых представлений видео, а её влияние ограничивается этим интервалом.

Таким образом, H3-World добавляет не модель действий, а механизм временного согласования команд с генерируемой последовательностью. Это существенное различие: проект повторно использует знания MiniMax-H3 о языке, объектах и движении, но отдельно обучает модель соблюдать момент начала и окончания действия.

Для адаптации использовано 8 000 игровых примеров и низкоранговая адаптация LoRA, при которой обновляется только небольшая часть весов исходной модели. Обучение заняло 10 000 шагов, а доля обучаемых параметров составила 0,199%. Эти показатели описывают объём адаптации большой предварительно обученной модели, а не полную стоимость создания H3-World: базовое обучение MiniMax-H3 в них не учитывается.

Что это меняет для команд, которые строят управляющих агентов

H3-World даёт архитектурный вариант для продуктов, где состояние среды уже генерирует крупная видеомодель с развитым текстовым управлением. Вместо отдельного кодировщика действий команда может проверить, достаточно ли преобразовать команды продукта в язык, понятный базовой модели, и дообучить временную привязку. Наиболее прямое применение подхода — интерактивные игровые сцены, управление виртуальными персонажами и камерой.

Заявленные 8 000 примеров и 0,199% обучаемых параметров показывают, что такая адаптация возможна без изменения большей части MiniMax-H3. Но на странице работы нет сравнительных результатов с системой, использующей отдельную модель действий. Поэтому эти числа подтверждают небольшой объём дообучения, но не доказывают конкретный коэффициент экономии данных, вычислений или стоимости относительно альтернативной архитектуры.

Эксперименты также относятся к управлению персонажем и камерой. Авторы сообщают о переносе на невиданные при обучении сочетания действий и визуальные сценарии, однако это не равнозначно переносу на произвольные пространства действий, робототехнику или длительное автономное планирование. Языковой интерфейс удобен там, где действие естественно описывается текстом; из представленных результатов не следует, что он заменяет специализированное управление в других средах.

Для продуктовых команд результат H3-World меняет прежде всего границу между моделью мира и управляющим интерфейсом. Отдельный обучаемый модуль для исполнения команд может оказаться необязательным, если базовый видеогенератор уже понимает нужные действия. Контур выбора действий и проверка устойчивости управления при длительной работе при этом остаются за пределами показанного решения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу