Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Ограничение доступного модели контекста может улучшить перенос рассуждений на задачи за пределами обучающего распределения. Chenxiao Yang и соавторы показывают, что модель с полной цепочкой рассуждений способна подменить общее правило опорой на соседние токены, хотя работа не рецензирована, а её числа получены самими авторами. Для систем рассуждения это аргумент в пользу изоляции подзадач, а не только расширения контекста.
В обычной цепочке рассуждений (Chain-of-Thought, CoT) модель читает весь ход решения. Рекурсивная языковая модель решает каждую подзадачу в отдельном контексте и не видит части трассы, которые для этого шага не нужны. Ограничение не добавляет модели новую способность, а не даёт использовать лишнюю информацию.
На задачах из того же распределения, что и обучение, оба подхода почти равноправны. CoT может воспроизвести рекурсивное правило, а теоретическая гарантия обобщения меняется только на постоянный множитель. Поэтому внутри знакомого распределения изоляция контекста даёт мало.
Разница возникает после смены распределения. Полная трасса позволяет подобрать простую зависимость от токенов вне текущей подзадачи; на обучающих примерах она работает, но ломается, когда эти токены меняются. Рекурсивная модель такого пути не имеет. При этом класс CoT включает правильное правило, однако предпочтение более простого решения направляет обучение к короткому пути, а не к правилу.
Вывод относится к сравнению стандартного CoT и рекурсивной изоляции на задачах внутри и вне обучающего распределения. Поскольку заметка основана только на абстракте, процедуру проверки и масштаб работы из него восстановить нельзя. Для архитектуры продукта следствие узкое: если подзадача должна сохранять поведение при смене окружающего контекста, ей стоит передавать только локально нужные данные.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



