Журнал · Rit.work

Изменяемая «доска» помогла LLaDA решать задачи с глобальными ограничениями

Blackboard позволяет диффузионной LLaDA пересматривать части решения и точнее соблюдать связанные ограничения, но требует больше вычислений при генерации.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковая модель научилась возвращаться к уже собранному решению и исправлять ранние ошибки, а не продолжать текст слева направо. В препринте команды Seoul National University, Harvard University и University of Central Florida, который не прошёл рецензирование и содержит замеры самих авторов, новый режим более чем вдвое обошёл усиленный поиск для авторегрессионной модели на сложных логических задачах. Такой способ генерации может изменить выбор архитектуры для расписаний, конфигураций и других продуктов, где все части ответа должны одновременно соблюдать общие правила.

Почему генерация слева направо мешает исправлять решение

Авторегрессионная модель выбирает следующий токен по уже созданному префиксу. Если раннее решение оказалось неверным, модель должна объяснить исправление в продолжении или заново сгенерировать весь последующий фрагмент. Сам интерфейс не даёт ей свободно заменить один элемент в середине ответа.

На задачах с глобальными ограничениями эта особенность становится существенной. В ZebraLogic нужно совместить все подсказки логической головоломки, в Nurse Rostering — распределить сотрудников по сменам с учётом нагрузки и покрытия, а в Job-Shop Scheduling — назначить операции станкам, соблюсти их порядок и минимизировать общее время работы. Локально правдоподобный выбор может нарушить правило, связанное с далёкой частью решения.

Blackboard работает с фиксированным изменяемым полотном. Его заполняет диффузионная языковая модель LLaDA-8B-Instruct: она видит частично скрытый ответ, предсказывает содержимое любой незаполненной позиции и при необходимости снова скрывает уже выбранные элементы. Поэтому поиск идёт по состояниям решения, а не по единственной цепочке продолжений.

Модель при этом не меняли: Blackboard управляет только генерацией во время вывода. Один и тот же настроенный контрольный пункт можно запускать в обычном режиме или подключать к нему поиск, ветвление и пересмотр частей ответа.

Средняя уверенность показывает, когда решение начинает расходиться

Для каждой скрытой позиции LLaDA выдаёт вероятности возможных токенов. Blackboard берёт максимальную вероятность в каждой позиции и усредняет их. Получается средняя уверенность во всём текущем состоянии, а не только в следующем слове.

У правильно решённых головоломок этот показатель оставался выше и плавно рос по мере заполнения ответа. После неудачного выбора уверенность чаще падала или колебалась: открытая часть начинала хуже сочетаться с вариантами для оставшихся позиций. Та же связь проявилась в расписаниях, а в задачах оптимизации высокая уверенность чаще сопровождала оптимальные решения.

Это сигнал, а не формальная проверка ограничений. Теоретическое обоснование опирается на идеализированное распределение, где лучшие глобальные состояния получают большую вероятность. На практике Blackboard использует траекторию уверенности, чтобы решить, достаточно ли обычной генерации или нужно запустить более дорогой корректирующий поиск.

Такой запуск по условию оказался полезнее постоянного исправления. Система не тратила одинаковый бюджет на простые и трудные примеры и не перезаписывала без необходимости решения, которые обычный режим уже собрал правильно.

Когда результат меняет архитектурный план

На ZebraLogic-Hard обычная генерация LLaDA дала точность 78,4%, а Blackboard поднял её до 90,4%. Цена прироста — примерно в 3,7 раза больше обращений к модели. Поэтому сравнивать подходы только по точности недостаточно: для продукта потребуется отдельно измерить задержку и стоимость вывода.

На Nurse Rostering система получила 76,4% полностью допустимых расписаний. На Job-Shop Scheduling она нашла оптимальные решения в 80,2% случаев. Во всех трёх случаях метрика требовала соблюсти задачу целиком: частично правильный ответ не засчитывался как успех.

Проверка охватывала три синтетических или адаптированных набора задач с формально заданными ограничениями. Для каждого домена LLaDA настраивали на специализированных примерах, а затем сравнивали режимы генерации на отложенных заданиях. Вывод относится прежде всего к структурированным задачам, где решение можно представить на фиксированном полотне и точно проверить.

Для команды, которая строит планировщик или генератор конфигураций, работа добавляет к выбору модели ещё один вопрос: какое промежуточное состояние она открывает во время вывода. Если продукт сейчас просит обычную LLM сразу выдать окончательную таблицу или расписание, имеет смысл сравнить этот вариант с изменяемым состоянием и отдельным контролем ограничений.

Работа не показывает, что диффузионная модель должна заменить авторегрессионную в чатах, поиске или программировании. Практический кандидат — гибрид: модель собирает и пересматривает решение, формальный проверяющий модуль принимает только допустимый результат, а дополнительный поиск включается по сигналу уверенности. Перед сменой архитектуры такой прототип стоит проверить на собственных типах конфликтов и считать не только долю верных ответов, но и число обращений к модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу