Журнал · Rit.work

Кривая ошибки может скрывать обучение представления

AGOP показывает, что нейросеть может выделить полезные направления в данных ещё до заметного снижения ошибки.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Нейросеть может почти не снижать ошибку, но уже учиться выделять все направления в данных, от которых зависит правильный ответ. В препринте Akash Kumar из UCSD, который не прошёл рецензирование, а числа в нём рассчитаны самим автором, минимальное совпадение найденного подпространства с целевым выросло как минимум на 0,5 ещё внутри плато. Поэтому ранняя остановка только по кривой ошибки может прервать обучение уже полезного представления.

Работа рассматривает двухслойные сети ReLU и leaky-ReLU, которые обучаются градиентным спуском с фиксированным шагом и малой случайной инициализацией. Чтобы отделить геометрию признаков от выходного сигнала, используется усреднённая матрица внешних произведений градиентов по входу (AGOP): её ведущие собственные векторы показывают направления, к которым предсказание сети наиболее чувствительно.

Полезность признаков проверяли отдельно от текущих выходных коэффициентов сети. Для этого выходной слой подбирали заново с теми же ограничениями до и после обучения. Пока исходная ошибка оставалась высокой и почти неизменной, среднеквадратичная ошибка такого повторного подбора снизилась более чем на 0,399. Позже та же траектория обучения опустила исходную ошибку ниже всех значений внутри плато.

Теорема действует для гауссовских входов, точных градиентов по всему распределению и структурированных целевых функций. Эксперименты дополняют её расчётами для 21 целевой функции и 50 случайных инициализаций на каждую. Такой масштаб показывает, что эффект не сводится к одной удачной траектории, но работа пока описывает механизм, а не практическую оценку времени обучения или нужного объёма данных.

Для систем обучения это меняет смысл плато: неизменная ошибка не обязательно означает, что параметры перестали извлекать структуру. AGOP и повторный подбор выходного слоя могут служить дополнительными диагностическими сигналами, когда решение о продолжении обучения нельзя принимать только по значению функции потерь.

Источники

Иллюстрация: рисунок из статьи «Awakening of the Buddha: Subspace Learning During Population-Loss Plateaus», Akash Kumar, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу