Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Тонкую настройку LLM научились привязывать к локальной геометрии сохранённого домена, чтобы обучение коду меньше меняло ответы по математике и здравому смыслу. В нерецензированном препринте, где все числа получили сами авторы, ATLAS снизил сдвиг выходов на 10,16–17,60% относительно семи опубликованных методов при одинаковом результате на коде. Такой подход позволяет обновлять модель точнее, но требует доступа к её внутренним состояниям и добавляет вычисления при генерации.
Как атлас задаёт обновлению адрес
Обычная тонкая настройка меняет общие параметры модели. Поэтому обучение на коде затрагивает и те входы, которых не было в обучающем наборе: модель может иначе решить математическую задачу, выбрать другой вариант ответа или заменить одну ошибку другой.
ATLAS заранее строит карту активаций на примерах из домена, поведение которого нужно сохранить. В работе такими доменами служат GSM8K с математическими задачами и CommonsenseQA с вопросами на здравый смысл. Примеры для построения карты отделены от тех, на которых затем измеряют изменения.
Карта состоит из локальных областей. Для каждой области метод хранит центр и основные направления, вдоль которых меняются внутренние состояния токенов. Эти направления находят методом главных компонент: он выделяет характерную для соседних состояний геометрию без дополнительной разметки.
Во время обучения и генерации текущее состояние токена направляется к ближайшим областям карты. Их центры задают точку отсчёта, а направления работают как фильтр: остаточная ветвь слабее читает и создаёт изменения вдоль тех осей, которые типичны для сохраняемого домена.
Само новое умение хранится в общей низкоранговой ветви. Для Qwen3-8B она содержит 131 072 обучаемых параметра; число таких параметров не растёт вместе с количеством областей карты. Базовая модель и атлас остаются замороженными, обновляются только два общих множителя этой ветви.
ATLAS отличается от ограничений на веса тем, что выбирает правило обновления для каждого входа. Один токен может оказаться рядом с математическими состояниями, другой — далеко от них, поэтому одна и та же обучаемая ветвь действует на них по-разному. Атлас при этом нужен не только во время настройки: маршрутизация и фильтрация продолжают работать при каждом запуске модели.
Сдвиг измеряли при одинаковом качестве кода
Целевой навык обучали на MBPP и проверяли усиленными тестами MBPP+. Сохранность оценивали по тому, насколько изменилось распределение вероятностей следующего токена на прежних задачах. Для этого использовали дивергенцию Кульбака — Лейблера: чем она ниже, тем ближе обновлённая модель к исходной по своим вероятностям.
Такое сравнение легко исказить, если одна модель просто хуже выучила код. Поэтому для каждого требуемого результата на MBPP+ исследователи выбирали контрольную точку с минимальным сдвигом и сравнивали методы только там, где они достигали общего порога. В основной проверке ATLAS обошёл ограничения на подпространства, входозависимые преобразования и методы, которые меняют вклад отдельных обучающих токенов.
Самый большой вклад дал не направляющий фильтр, а вычитание локального центра перед преобразованием. Расстояние до центра и направления локальной вариации добавили меньший эффект. Это важная практическая деталь: основная польза возникает уже тогда, когда обновление получает локальную точку отсчёта, а полная конструкция уточняет её действие.
Проверка охватила пять базовых моделей семейств Qwen и GLM и два сохраняемых домена. Во всех повторных запусках ATLAS меньше сдвигал выходы, чем Plain, Replay и Output-KL; совокупное снижение составило 62,03%. Анализ отдельных ответов также показал меньше переписанных решений по математике и более стабильный выбор в CommonsenseQA.
Работа рассматривает обучение коду через остаточную ветвь в одном слое. Она проверяет сохранность математики и ответов на здравый смысл, а не произвольное поведение продукта: системные инструкции, диалоги, вызовы инструментов и собственные данные приложения в этот контур не входят.
Меняет ли ATLAS планы команд
ATLAS стоит учитывать, если продукт обновляет открытую модель и зависит от совместимости ответов между версиями. Например, изменение формулировки или варианта ответа может сломать проверенные подсказки, правила маршрутизации и последующую обработку даже тогда, когда средняя точность не снизилась.
Метод не выглядит заменой обычной низкоранговой настройке для любого проекта. Сначала команде нужен репрезентативный набор из областей, которые следует сохранить. По нему придётся собрать внутренние активации, построить карту и затем держать её доступной при генерации.
Это исключает сценарии, где модель доступна только через внешний API: ATLAS вставляет ветвь в выбранный слой и работает с состояниями токенов. Для собственной модели появляется и постоянная цена исполнения — поиск ближайших областей, проекция входа и фильтрация выхода для каждого токена. В работе эти операции реализованы компактно, но их влияние на задержку конкретного сервиса придётся измерять на его длинах контекста и оборудовании.
Практический пилот должен сравнивать не только итоговую точность, но и изменения конкретных ответов относительно текущей версии. Полезно отдельно считать новые ошибки, случайные исправления и замены одного неверного ответа другим. Именно такое разложение показывает преимущество ATLAS лучше, чем одна усреднённая метрика сохранности.
Работа меняет план внедрения там, где побочные изменения уже стали самостоятельным риском: набор для сохранения поведения теперь можно использовать не только как тест или источник примеров для повторного обучения, но и как геометрическое правило внутри адаптера. Для настройки без требований к совместимости дополнительная карта и вычисления при генерации могут не окупиться.
Источники
Иллюстрация: рисунок из статьи «Learn Here, Move Less Elsewhere: Input-Conditioned Plasticity from Retained-Domain Activation Atlases», Jiangtao Lin, Bangyang Wei, Yihang Ding и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



