Журнал · Rit.work

Draft-KV проверяет, передаёт ли одна модель знания другой

Draft-KV передаёт между языковыми моделями состояния, сформированные во время ответа, и проверяет пользу канала заменой сообщения на чужое.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одну языковую модель научили передавать другой именно вычисления по текущему вопросу, а не общий сигнал от обученного адаптера. В препринте Draft-KV, который ещё не прошёл рецензирование и содержит замеры самих авторов, Qwen2.5-0.5B-Instruct с помощью Qwen3-8B достигла точности 78,04% против 37,45% без связи. Для команд, которые строят системы из нескольких моделей, работа предлагает более строгий тест: результат должен зависеть от содержания переданного сообщения.

Рост точности ещё не доказывает передачу знаний

Латентная связь передаёт между моделями внутренние состояния вместо текста. Это позволяет не превращать вычисления первой модели в токены, а затем не кодировать их заново во второй, но создаёт другую проблему: обученный интерфейс сам может улучшить получателя, даже если сообщение первой модели бесполезно.

Draft-KV отделяет общий прирост системы от пользы правильно подобранного сообщения. Для этого один и тот же получатель запускается с состояниями от текущего вопроса, с состояниями от постороннего вопроса и без связи. Разница между первыми двумя режимами показывает, использует ли модель переданный смысл.

При такой проверке C2C и LatentMAS почти не отреагировали на подмену. Чужое сообщение меняло точность максимум на 0,60 процентного пункта, хотя обученный интерфейс мог добавлять 15,44 пункта относительно получателя без связи. Значит, основной выигрыш давал сам адаптер, а модель-отправитель можно было убрать без заметной потери.

Это меняет трактовку прежних результатов. Сравнение только с одиночной моделью показывает пользу всей обученной конструкции, но не подтверждает обмен знаниями. Если более сильного отправителя заменяет случайное внутреннее состояние, канал не переносит его преимущество.

Как Draft-KV привязывает сообщение к текущему ответу

Отправитель сначала составляет черновик ответа. Draft-KV берёт ключи и значения механизма внимания, сформированные на позициях этого черновика: в них уже отражены вопрос и предыдущие токены ответа. Состояния исходного запроса для этой цели хуже, потому что при причинном внимании они не меняются после появления черновика.

Линейные преобразования переводят состояния отправителя в формат получателя. Тот читает их как отдельную память через дополнительную ветвь внимания, а обучаемые затворы регулируют влияние сообщения в каждом слое. Собственная память получателя при этом не смешивается с переданным пакетом.

Обе языковые модели остаются замороженными: обучается только мост между ними. В нём 1,05 млн параметров — в 348 раз меньше, чем в интерфейсе C2C, с которым его сравнивают. Однако мост приходится обучать отдельно для каждой пары моделей.

Обучение идёт поэтапно. Сначала получатель учится восстанавливать текст только из переданных состояний, затем связывает черновик с правильным ответом. На последнем этапе штраф ограничивает вред от сообщения, взятого у другого вопроса: получатель должен извлекать пользу из подходящего пакета, но не доверять любому поступившему состоянию.

Удаление ранних этапов ухудшало результат, особенно на задаче, которая не входила в финальное обучение. Замена состояний черновика на состояния запроса почти уничтожала зависимость от правильно подобранного сообщения. Поэтому эффект связан не только с архитектурой моста, но и с тем, в какой момент отправитель формирует передаваемые данные.

Когда подход меняет архитектурные планы

Метод проверяли на семействах Qwen3, Qwen2.5 и Llama-3.2. В открытом режиме обе модели получали один вопрос из MMLU-Redux, ARC, OpenBookQA или C-EVAL. В отдельном режиме им делили подтверждающие факты из HotpotQA и 2WikiMultihopQA, чтобы каждая сторона знала только часть нужной информации.

Обучение на задачах с вариантами ответа использовало ARC, а остальные наборы служили проверкой переноса. Польза правильно подобранного сообщения сохранялась на отложенных задачах, росла вместе с возможностями отправителя и проявлялась при разделённых фактах. В отдельных условиях совместная система отвечала точнее обеих моделей по отдельности.

Для проектирования составной системы главный практический вывод — добавить подмену сообщений в обязательные испытания. Нужны три режима: правильное сообщение, сообщение от другого запроса и отсутствие канала. Без такого сравнения команда рискует принять обычную донастройку получателя за передачу знаний.

Draft-KV имеет смысл рассматривать там, где сильная модель должна помогать меньшей, а текстовый ответ теряет часть внутренних вычислений. Цена подхода — отдельный черновик отправителя, последовательный запуск обеих моделей и обучение моста для конкретной пары. Это не универсальная замена текстовому обмену, но уже проверяемая архитектура для сценариев, где модели обладают разными знаниями.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу