Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Знания сильной LLM удалось перенести в слабую модель обычным текстом, не меняя её веса. В препринте Zhanyi Lu и Huan Wang, который не прошёл рецензирование и приводит замеры самих авторов, доля правильно решённых математических задач выросла с 27,6% до 51,7%. Подход подходит для моделей, доступных только через API, и снижает зависимость перенесённых знаний от конкретного снимка весов.
Как разницу между моделями превращают в учебник
Обычная дистилляция знаний переносит возможности сильной модели-учителя в модель-ученика через обучение. Ответы или рассуждения учителя становятся обучающими данными, после чего команда обновляет веса ученика. Полученный навык остаётся связан с этой моделью и её версией.
Метод Universal Textual Teaching, или UTT, вместо весов создаёт Primer — текстовый учебник с правилами, приёмами и примерами. При использовании Primer добавляют в контекст запроса. Веса ученика и учителя остаются неизменными.
Сначала обе модели решают одни и те же задачи. UTT выделяет случаи, где учитель справляется лучше ученика: именно они показывают, какое знание стоит переносить. Отдельно сохраняются задачи, уже доступные ученику, и задачи, которые не решила ни одна модель. Так можно проверить, не портит ли новый текст прежние навыки и помогает ли он выйти за возможности учителя.
Для каждого обнаруженного пробела ученик делает попытку и получает обратную связь от проверяющего механизма. Отдельная роль превращает ошибку в учебное указание, учитель показывает решение, а сборщик объединяет подтверждённые уроки с текущей версией Primer. Демонстрацию добавляют только после успешной проверки.
Каждую новую версию Primer испытывают на той же порции задач. Если ученик решает с ней меньше примеров, обновление отклоняют. Итог проверяют и на отложенных задачах, которые не участвовали в сборке текста.
Текст помог на генерации кода и олимпиадной математике
На KernelBench исходная доля корректных GPU-ядер выросла с 9,4% до 48,6%. Этот бенчмарк запускает сгенерированный код и проверяет не только результат, но и скорость относительно реализации на PyTorch. На Omni-MATH-2 модель решала олимпиадные задачи с заранее известными ответами.
UTT сравнили с отдельными примерами в запросе, автоматической оптимизацией инструкций и методами дистилляции, которые обновляют веса. Он показал лучший результат во всех представленных сочетаниях задач, моделей и метрик. В конфигурации Pro→Qwen преимущество над сильнейшим методом с обучением весов достигло 8,2 процентного пункта на KernelBench.
Primer оказался переносимым и между учениками. Текст, собранный при работе учителя с одной моделью, подключали к другой без повторной сборки; прирост точности на KernelBench доходил до 41,8 процентного пункта. Значит, в изученных конфигурациях текст описывал не только особенности ошибок конкретного ученика, но и более общие способы решать задачу.
Проверка охватывала KernelBench и Omni-MATH-2, несколько пар учителей и учеников, включая Qwen3.6-27B, а также отдельный опыт с геометрическими задачами для мультимодальных моделей. Основные выводы относятся к генерации GPU-ядер и математическим рассуждениям, где ответ можно автоматически проверить.
Когда UTT меняет план разработки
UTT стоит рассматривать, если модель нельзя обучать, её обновление дорого или продукт должен переживать замену поставщика. Вместо отдельной дообученной версии команда получает текстовый артефакт: его можно читать, хранить рядом с кодом, переносить между моделями и проверять после изменений.
Подход не устраняет вычислительные расходы, а переносит их из обучения в сборку Primer. Для этого нужны повторные вызовы ученика и учителя, проверка ответов и несколько итераций сборки. При эксплуатации Primer также занимает часть контекста каждого запроса, поэтому его влияние на задержку и расход токенов нужно измерять на целевой системе.
Название «универсальный» не означает, что один учебник подходит для любых задач. Primer строится на конкретном наборе примеров и зависит от качества автоматической проверки. Там, где правильность нельзя надёжно оценить — например, в свободном диалоге или работе с неоднозначными требованиями, — фильтр может принять убедительную, но ошибочную демонстрацию.
Сохранение прежних навыков тоже не гарантировано: в части математических конфигураций Primer ухудшал результат на задачах, которые ученик раньше решал самостоятельно. Перед внедрением нужен собственный набор проверок, разделённый на перенос нового навыка, сохранение существующего поведения и работу на ранее не встречавшихся примерах.
Практический выбор теперь не сводится к сравнению готового запроса и дообучения. Между ними появляется третий вариант: собрать проверяемый текст из реальных различий учителя и ученика. Он особенно полезен как промежуточный шаг, когда команда ещё выбирает модель или не хочет привязывать предметные правила к одному набору весов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



