Журнал · Rit.work

HarnessBandit выбирает обвязку для каждого шага обучения LLM

Совместная оценка обучаемости и переноса помогла Qwen3.5-2B обойти смешанное обучение на PinchBench и ClawEval, но эксперимент охватывает одну модель и два тестовых набора.

Rit.work
Студия разработки
15 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агентная LLM стала лучше переносить навыки между разными обвязками, когда интерфейс для каждого шага обучения выбирали по текущей пользе. Хотя препринт Harbin Institute of Technology и Alibaba Cloud не прошёл рецензирование и все числа в нём получили сами авторы, HarnessBandit поднял средний результат Qwen3.5-2B на PinchBench с 0,331 у обучения в общем потоке из шести обвязок до 0,506. Если продукт запускает одну модель через разные наборы инструментов и циклы управления, простое смешивание обучающих траекторий может оказаться слабой стратегией.

Обвязка здесь — системная инструкция, схема инструментов, цикл управления агентом и правила ведения сеанса. Разные обвязки меняют траектории модели даже на одной задаче, поэтому обновление, полезное для одного интерфейса, может мешать остальным.

HarnessBandit оставляет целевую функцию GRPO без изменений, но на каждом шаге выбирает одну обвязку и собирает через неё весь пакет траекторий. Диспетчер учитывает два сигнала. Обучаемость показывает, насколько результаты траекторий отличаются внутри группы: если награды одинаковы, модель почти не получает сигнала для обновления. Переносимость показывает, насколько направление градиента выбранной обвязки совпадает с недавними направлениями остальных; для сравнения используют сокращённые копии градиентов.

На ClawEval доля задач, решённых хотя бы в одной из трёх попыток, достигла 41,6% против 38,5% у смешанного обучения через шесть обвязок. Однако по более строгой метрике, где требуются три успешные попытки, HarnessBandit лишь повторил результат исходной Qwen3.5-2B — 26,7%. Метод улучшил средний результат, но не сделал поведение модели стабильно успешным.

Проверка охватывает Qwen3.5-2B, шесть обвязок и 2 000 задач ClawGym при одинаковом бюджете в 150 шагов. PinchBench содержит новые задачи, но использует знакомую по обучению OpenClaw; в ClawEval новыми были и задачи, и управляющий цикл. Для внедрения подхода потребуется разделять пакеты по обвязкам и получать градиенты во время обучения, то есть это надстройка для собственного контура GRPO, а не настройка готового API.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу