Журнал · Rit.work

Как модели с неизменяемыми весами учатся на опыте без дообучения

Внешняя инструкция, память фактов и база визуальных примеров позволяют накапливать опыт эксплуатации, проверять обновления и переносить их между моделями.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель с неизменяемыми весами научили улучшать ответы по мере разбора новых медицинских случаев. Система команды University of Maryland и NVIDIA повысила показатели на медицинских задачах до 34,2%, однако работа не рецензирована, а все числа получены самими авторами. Подход позволяет обновлять прикладную экспертизу без доступа к весам модели и повторного обучения.

Опыт хранится в трёх внешних слоях

После каждого пакета случаев система обновляет не базовую модель, а внешнюю экспертизу. Она состоит из рабочей инструкции Skill, памяти знаний и мультимодальной базы MMKB.

Skill описывает порядок рассуждений и обращения к инструментам. Например, инструкция может потребовать сначала проверить признаки, которые различают два диагноза, и только затем назначать дополнительное исследование. Оптимизатор переписывает документ целиком: добавляет недостающие шаги, сужает слишком общие правила и удаляет советы, которые не помогли.

Полная перезапись важна для эксплуатации. Если только дописывать новые правила, контекст будет расти, а старые и новые указания начнут противоречить друг другу. Ограниченный по длине документ проще передавать другой модели и проверять как отдельную версию.

Память знаний хранит факты вместе с подтверждениями и условиями применения. Источником служат проверенные случаи или внешние медицинские материалы, включая PubMed. Наблюдение об одном пациенте не превращается в общее правило без прямого подтверждения из доверенного источника.

MMKB сохраняет изображения, исходные вопросы, правильные ответы и пояснения, если они есть. Для нового случая система находит похожие примеры, но модель должна не копировать их ответы, а сопоставить признаки, различия и недостающие данные. Даже ошибочно решённый случай можно добавить в базу после того, как становится известен эталонный ответ.

Обновление проходит проверку на новых и прежних случаях

Система обрабатывает поток пакетами по 32 случая. Сначала действующая версия отвечает на весь пакет, и эти ответы считаются окончательными. Только после этого открываются оценки и эталонные ответы, а оптимизатор предлагает новую версию Skill и памяти.

Кандидат запускают параллельно на следующем пакете и на буфере прежних случаев. Обновление принимают, если на новых данных средний результат вырос и улучшенных случаев не меньше, чем ухудшенных. На старом буфере допускается равенство, но не снижение. Кандидатные ответы нужны только для сравнения и не подменяют ответы, которые система уже выдала в рабочем потоке.

Буфер тоже меняется: отдельная модель выбирает из пройденных случаев набор, который покрывает разные типы вопросов. Ответы и оценки при этом выборе ей не показывают. Периодически текущую экспертизу сравнивают с одной из сохранённых версий и возвращают прежнюю, если новая работает хуже.

Проверку провели на шести наборах задач: интерактивной диагностике, клинических процессах, медицинских рассуждениях, анализе медицинских изображений и двух немедицинских визуальных задачах. В экспериментах участвовали четыре открытые и закрытые модели, включая Qwen3.8-27B, Nemotron-3-Nano-Omni-30B, GPT-5.6-Sol и GPT-4o-mini. MMKB использовали только там, где вход содержал изображения.

Подход меняет слой адаптации, но не отменяет контроль качества

Для проверки переноса авторы накопили экспертизу примерно на первых 70% потока, затем запретили дальнейшие обновления. На оставшихся случаях система обошла исходную модель в 21 из 24 сочетаний задачи и модели. Средний выигрыш составил 20,7%, поэтому результат нельзя объяснить только запоминанием уже разобранных примеров.

Экспертизу также переносили между базовыми моделями без дополнительной оптимизации. Это полезно для архитектуры продукта: инструкции, подтверждённые факты и визуальные примеры можно хранить как самостоятельный слой, а не встраивать в веса конкретной LLM. При смене поставщика или версии модели такой слой не приходится собирать заново с нуля.

Работа меняет планы команд, которым нужно регулярно учитывать новые правила, проверенные случаи или обратную связь, но нельзя дообучать закрытую модель. Вместо конвейера обучения можно проектировать версионируемое хранилище экспертизы с теневой проверкой кандидатов и возможностью отката.

При этом обновление без обучения не означает обновление без инфраструктуры. Нужны отдельный оптимизатор, поиск по памяти, хранение изображений, повторные прогоны на буфере и правила, которые не допускают попадания ответа текущего случая в выдачу. В медицине результаты относятся к указанным наборам задач и их эталонным ответам, а не к проверке системы в клинической практике.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу