Журнал · Rit.work

CM-DPO учитывает тяжесть нарушения при обучении LLM-планировщика

CM-DPO усиливает штраф за крупные нарушения и не позволяет LLM-планировщику жертвовать обязательными условиями ради пользовательских предпочтений.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM-планировщик научили различать мелкие и крупные нарушения правил, а обязательные условия отделять от пожеланий. В препринте PayPal AI Lab, который не прошёл рецензирование и приводит числа, полученные самими авторами, модель на 8 млрд параметров довела долю планов, прошедших проверку, до 89,2%. Подход позволяет перенести часть контроля из многошаговой проверки во время работы модели в её обучение.

Обычная прямая оптимизация предпочтений DPO одинаково воспринимает перерасход бюджета на 1 и 1000 долларов: оба ответа получают бинарную метку «хуже». CM-DPO вместо неё использует величину нарушения, которую рассчитывает детерминированный символьный проверяющий модуль. Чем сильнее план вышел за бюджет, нарушил расписание или условие совместимости, тем сильнее обучение отталкивает модель от такого ответа.

Жёсткие правила и мягкие предпочтения обучают раздельно. Сначала модель должна выполнить бюджет, сроки и другие обязательные условия; только среди допустимых планов она может выбирать предпочтительный отель, перевозчика или бренд. Для обучающих пар o3-mini исправляла черновики GPT-4o-mini минимальными правками: в среднем менялись 32 токена против примерно 245 при полном переписывании. Так модель с меньшей вероятностью принимает стиль учителя за признак правильного ответа.

Для обучения собрали 15 000 проверенных пар в задачах путешествий и розничного подбора. Метод проверяли на TravelPlanner, NaturalPlan и PlanBench, включая незнакомые при обучении задачи Blocksworld. На них модель обошла GPT-4o на 9,2 процентного пункта, а с многоагентными системами сравнялась при задержке в 13 раз ниже. Сам подход зависит от формализуемого проверяющего модуля: в ручной перепроверке его решения совпали с разметкой в 98,7% случаев.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу