Журнал · Rit.work

Новую способность малой LLM предсказали до скачка качества

Эксперимент на малых трансформерах показывает, как калибровать предупреждение о новой способности и отсекать ложные тревоги на специально заблокированных запусках.

Rit.work
Студия разработки
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Момент, когда малая языковая модель осваивает новую способность, удалось определить заранее для каждого отдельного запуска, а не задним числом по кривой обучения. В работе Gunner Levi Howe предупреждение появлялось за 975 шагов до скачка, тогда как функция потерь давала лишь 50 шагов; это нерецензированный препринт, и все числа получили сами авторы. Для команд, которые обучают свои модели, результат задаёт схему мониторинга: искать внутренний предвестник, калибровать диапазон времени и отдельно проверять ложные тревоги.

Проверяемой способностью стала индукция: модель замечает повторённый фрагмент контекста и использует продолжение первого вхождения, чтобы предсказать следующее. Предвестником служил механизм внимания к предыдущему токену, который формируется раньше. По времени его появления система оценивала, когда способность проявится в поведении модели.

При одной конфигурации обучили 30 двухслойных трансформеров с разными начальными значениями параметров. Предвестник почти точно сохранял порядок запусков от ранних к поздним, а интервалы накрыли фактический момент появления способности во всех отложенных испытаниях. После заморозки правила оно сохранило покрытие 10/10 и 9/10 на двух ранее не использованных конфигурациях. Основной тест охватывал малые модели, синтетические языки и одну способность; контрольные точки Pythia, OLMo и OLMo-2 подтвердили только то, что внутренний механизм возникает раньше поведения.

Одиночного внутреннего сигнала оказалось недостаточно. В специально устроенном языке он поднял тревогу в 10/10 запусков, где способность была искусственно заблокирована. Составное правило, которое требовало одновременно внутренний предвестник и ранний поведенческий признак, не дало ложных тревог на 33 заблокированных запусках.

Фиксированный интервал между сигналом и способностью не переносился на любой режим: изменение темпа обучения и размера пакета сдвигало его примерно в 2,3 раза. Вместо прибавки постоянного числа шагов подошло соотношение: способность появлялась примерно в момент, равный времени сигнала, умноженному на 1,19. Это правило прошло отдельную слепую проверку на новой конфигурации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу