Журнал · Rit.work

Дообучение NoThink частично возвращает модели режим Think

Причинный аудит показал, что часть прироста NoThink возникает из повторного включения рассуждений, уже доступных модели в режиме Think.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Прирост точности в быстром режиме NoThink может возникать не из новой способности модели, а из повторного включения поведения режима Think с явной цепочкой рассуждений. В препринте Pennsylvania State University, который не прошёл рецензирование, а все числа в нём получили сами авторы, от 42% до 79% улучшения зависело от такого сдвига. Поэтому при оценке дообучения недостаточно сравнивать итоговую точность.

Для проверки выделили направление во внутренних активациях, которое отличает Think от NoThink в исходной модели. Затем активации сдвигали по нему в обе стороны: приближали базовую модель к Think и возвращали дообученную модель к исходному состоянию NoThink. Веса при этом не менялись, поэтому вмешательство позволяло отделить влияние уже доступного рассуждения от остальных последствий дообучения.

Сдвиг базовой модели к Think воспроизвёл 92–110% прироста лучшего дообученного варианта относительно исходного NoThink. Обратное вмешательство убирало заметную часть приобретённой точности. Два направления проверки дали согласованный результат: улучшение не просто сопровождалось похожими на Think активациями, а причинно зависело от них.

Проверка охватила Qwen3-8B, Qwen3-4B и MiniCPM4.1-8B, три способа дообучения и 120 задач олимпиадной математики из семейств AIME и HMMT. Основной расчёт опирался на одно направление активаций, поэтому измеренная доля описывает только найденный компонент утечки. Оставшийся прирост нельзя автоматически считать новой способностью NoThink: для этого потребовался бы аудит других направлений, архитектур и типов задач.

Для команд, которые дообучают гибридную модель ради дешёвых ответов, вывод практический: точность NoThink сама по себе не подтверждает, что модель научилась лучше отвечать без рассуждений. К оценке стоит добавлять проверку длины и структуры ответов, внутренних представлений и устойчивости прироста при вмешательстве в признаки режима Think.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу