Журнал · Rit.work

ScopeIF: награда за частичное соблюдение сложных инструкций

ScopeIF разделяет ограничения на область действия, измеряемый объект и диапазон, а затем награждает модель за степень соблюдения каждого требования.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научили точнее соблюдать ограничения, которые относятся не ко всему ответу, а к отдельным предложениям, абзацам или структурным блокам. Команда Tsinghua University и Zhipu AI довела дообученные Qwen3-4B и Qwen3-8B до уровня Gemini-2.5-Pro и DeepSeek-V3.2 на задачах точного следования инструкциям; поскольку препринт не рецензирован, все числа в нём получены самими авторами. Для продуктовой разработки это предлагает более информативный способ обучать модель там, где обычная проверка «выполнено или нет» почти не помогает.

Scope, Target и Range превращают инструкцию в проверяемую структуру

Обычные наборы для обучения часто описывают ограничение цельным шаблоном: ответ должен содержать определённое число слов или соответствовать формату JSON. Такой подход плохо выражает требования вроде «каждый заголовок состоит из восьми слов» или «последнее предложение каждого абзаца заканчивается вопросительным знаком».

ScopeIF раскладывает каждое ограничение на три части. Scope задаёт область действия: весь ответ, каждый абзац, элемент в определённой позиции или фрагмент, выбранный по условию. Target определяет, что измерять: длину, ключевое слово, знак препинания, поле JSON, порядок элементов или связь между ними. Range описывает допустимое значение — точное число, интервал, запрет, неравенство или зависимость от другой части ответа.

Такое разложение позволяет собирать новые ограничения из совместимых частей, а не писать отдельный шаблон для каждого случая. Области действия можно вкладывать друг в друга: например, выбрать последнее предложение в каждом абзаце, а затем измерить в нём число слов.

На этой схеме построен ScopeInstruct — набор из 17 968 сложных инструкций. Сначала модель генерирует отдельные ограничения из разных сочетаний Scope, Target и Range, затем объединяет их в реалистичные задания. Фильтрация убирает противоречивые требования, неоднозначные формулировки и неверные списки ограничений.

Степень ошибки даёт модели сигнал для обучения

Бинарная награда считает одинаково неверными два ответа: один превысил предел на слово, другой полностью нарушил структуру. Для требования, которое действует на каждый абзац или связывает несколько фрагментов, идеальный ответ встречается редко. Во время обучения большинство вариантов поэтому получает одинаковую оценку, и алгоритму трудно выбрать лучший.

ScopeIF сначала измеряет нарушение. Модель-оценщик выделяет нужные части ответа и при необходимости пишет небольшой инструмент на Python, который считает слова, проверяет структуру или извлекает элементы. Код запускается в интерпретаторе, а результат возвращается оценщику как основание для решения.

Инструмент создаётся с учётом конкретного ответа. Это помогает разобрать заголовки или списки, даже если модель оформила их не так, как ожидал заранее написанный валидатор. Правила дают точный подсчёт, а модель определяет, какие фрагменты нужно проверить.

После проверки ScopeIF сравнивает измеренное значение с допустимым диапазоном. Полное соблюдение получает максимальную награду, а оценка плавно уменьшается по мере удаления от границы. Частичные оценки объединяются с бинарным сигналом, поэтому обучение по-прежнему выделяет полностью правильные ответы, но различает и несколько неидеальных вариантов.

На тесте проверки ограничений связка GPT-OSS-120B с динамическими инструментами совпала с человеческой разметкой в 93,5% случаев. Чистая модель-оценщик достигла 92,3%, а проверка правилами — 86,0%. Основной выигрыш ScopeIF рос вместе со сложностью области действия и был наибольшим для вложенных областей.

Менять стоит контур обучения, а не рабочий API

Работа влияет прежде всего на команды, которые дообучают открытую модель или строят собственный набор проверок. Если требования можно объективно измерить, схема Scope, Target и Range даёт единый формат для генерации заданий, проверки ответов и расчёта награды.

ScopeIF не требует добавлять оценщик в каждый рабочий запрос. Модель-оценщик и интерпретатор нужны в контуре подготовки данных и обучения. После дообучения приложение вызывает модель обычным способом, хотя критичные форматы всё равно разумно проверять детерминированным валидатором.

Метод проверяли на Qwen3-4B и Qwen3-8B, а качество следования инструкциям оценивали на ScopeInstruct, IFEval, IFBench и IFHierBench. Сравнением служили методы с бинарной наградой за всю инструкцию или отдельные ограничения. На MATH-500, GPQA и MMLU-Pro изменения результатов после обучения укладывались в один процентный пункт, то есть улучшение формата ответа не сопровождалось заметной потерей общих способностей в этих тестах.

Работа охватывает объективные требования, которые можно посчитать или однозначно проверить. Она не решает оценку тона, убедительности и других качеств, где правильный ответ зависит от субъективного суждения. В статье также не рассчитана стоимость динамической проверки, поэтому экономику такого контура придётся измерять на собственных объёмах.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу