Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи Meta AI представили CORAL — систему для непрерывной оптимизации работающих рекомендательных систем; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, на одной из платформ число сессий с просмотром видео выросло на 0,16% без дополнительных затрат на обслуживание запросов. Подход важен командам, которым нужно регулярно перераспределять ресурсы рекомендаций по онлайн-метрикам, а не вручную пересматривать каждую настройку.
Что сделали
CORAL работает как управляющий контур поверх рекомендательной системы, а не генерирует рекомендации для каждого пользователя. Агент получает агрегированные показатели компонентов, историю собственных решений и результаты A/B-экспериментов, после чего предлагает новую конфигурацию. Отдельный численный оптимизатор пересчитывает предложение в ближайшую допустимую конфигурацию, которая не превышает установленный бюджет.
Порядок действий задан системой и не выбирается моделью: анализ показателей, извлечение истории, оценка предыдущего изменения, подготовка следующего решения и проверка ограничений. Цикл повторяли каждые три дня, а в памяти сохраняли три последних цикла. Параметры LLM при этом не обновлялись: агент корректировал решения за счёт контекста с предыдущими результатами.
Авторы проверили один контур на двух задачах. В первой он непрерывно распределял бюджет извлечения кандидатов между источниками. Во второй назначал группам пользователей варианты обслуживания с разной вычислительной стоимостью; на следующем раунде экономия выросла ещё на 44%, а изменение вовлечённости осталось в пределах погрешности.
Что это значит
Практическая схема отделяет вероятностное решение LLM от жёстких ограничений. Модель интерпретирует разнородные сигналы и предлагает изменения, но соблюдение бюджета обеспечивает детерминированный оптимизатор. Поскольку LLM вызывается на цикл управления, а не на пользовательский запрос, её вычислительная нагрузка не растёт вместе с трафиком.
Ограничения. Авторы провели A/B-эксперименты на двух поверхностях социальных платформ с миллионами пользователей, но проверяли только распределение ограниченных ресурсов между компонентами и сегментами. Работа не показывает, как контур справится с изменением логики извлечения или ранжирования. В экспериментах также нет прямого сравнения с ручной оптимизацией инженерами, обычным численным методом или другим агентным контуром, а эксплуатация пока сохраняет человеческий надзор.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



