Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель с неизменяемыми весами научили улучшать ответы по мере разбора новых медицинских случаев. Система команды University of Maryland и NVIDIA повысила показатели на медицинских задачах до 34,2%, однако работа не рецензирована, а все числа получены самими авторами. Подход позволяет обновлять прикладную экспертизу без доступа к весам модели и повторного обучения.
Опыт хранится в трёх внешних слоях
После каждого пакета случаев система обновляет не базовую модель, а внешнюю экспертизу. Она состоит из рабочей инструкции Skill, памяти знаний и мультимодальной базы MMKB.
Skill описывает порядок рассуждений и обращения к инструментам. Например, инструкция может потребовать сначала проверить признаки, которые различают два диагноза, и только затем назначать дополнительное исследование. Оптимизатор переписывает документ целиком: добавляет недостающие шаги, сужает слишком общие правила и удаляет советы, которые не помогли.
Полная перезапись важна для эксплуатации. Если только дописывать новые правила, контекст будет расти, а старые и новые указания начнут противоречить друг другу. Ограниченный по длине документ проще передавать другой модели и проверять как отдельную версию.
Память знаний хранит факты вместе с подтверждениями и условиями применения. Источником служат проверенные случаи или внешние медицинские материалы, включая PubMed. Наблюдение об одном пациенте не превращается в общее правило без прямого подтверждения из доверенного источника.
MMKB сохраняет изображения, исходные вопросы, правильные ответы и пояснения, если они есть. Для нового случая система находит похожие примеры, но модель должна не копировать их ответы, а сопоставить признаки, различия и недостающие данные. Даже ошибочно решённый случай можно добавить в базу после того, как становится известен эталонный ответ.
Обновление проходит проверку на новых и прежних случаях
Система обрабатывает поток пакетами по 32 случая. Сначала действующая версия отвечает на весь пакет, и эти ответы считаются окончательными. Только после этого открываются оценки и эталонные ответы, а оптимизатор предлагает новую версию Skill и памяти.
Кандидат запускают параллельно на следующем пакете и на буфере прежних случаев. Обновление принимают, если на новых данных средний результат вырос и улучшенных случаев не меньше, чем ухудшенных. На старом буфере допускается равенство, но не снижение. Кандидатные ответы нужны только для сравнения и не подменяют ответы, которые система уже выдала в рабочем потоке.
Буфер тоже меняется: отдельная модель выбирает из пройденных случаев набор, который покрывает разные типы вопросов. Ответы и оценки при этом выборе ей не показывают. Периодически текущую экспертизу сравнивают с одной из сохранённых версий и возвращают прежнюю, если новая работает хуже.
Проверку провели на шести наборах задач: интерактивной диагностике, клинических процессах, медицинских рассуждениях, анализе медицинских изображений и двух немедицинских визуальных задачах. В экспериментах участвовали четыре открытые и закрытые модели, включая Qwen3.8-27B, Nemotron-3-Nano-Omni-30B, GPT-5.6-Sol и GPT-4o-mini. MMKB использовали только там, где вход содержал изображения.
Подход меняет слой адаптации, но не отменяет контроль качества
Для проверки переноса авторы накопили экспертизу примерно на первых 70% потока, затем запретили дальнейшие обновления. На оставшихся случаях система обошла исходную модель в 21 из 24 сочетаний задачи и модели. Средний выигрыш составил 20,7%, поэтому результат нельзя объяснить только запоминанием уже разобранных примеров.
Экспертизу также переносили между базовыми моделями без дополнительной оптимизации. Это полезно для архитектуры продукта: инструкции, подтверждённые факты и визуальные примеры можно хранить как самостоятельный слой, а не встраивать в веса конкретной LLM. При смене поставщика или версии модели такой слой не приходится собирать заново с нуля.
Работа меняет планы команд, которым нужно регулярно учитывать новые правила, проверенные случаи или обратную связь, но нельзя дообучать закрытую модель. Вместо конвейера обучения можно проектировать версионируемое хранилище экспертизы с теневой проверкой кандидатов и возможностью отката.
При этом обновление без обучения не означает обновление без инфраструктуры. Нужны отдельный оптимизатор, поиск по памяти, хранение изображений, повторные прогоны на буфере и правила, которые не допускают попадания ответа текущего случая в выдачу. В медицине результаты относятся к указанным наборам задач и их эталонным ответам, а не к проверке системы в клинической практике.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



