Журнал · Rit.work

Witnesses проверяет обучение LLM без повторного запуска

Witnesses записывает проверяемое свидетельство обучения LLM и позволяет аудитору находить подмену данных или параметров без повторения всего запуска.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Обучение LLM научились проверять без полного повторения дорогостоящего запуска. Witnesses добавил к обучению модели до 19% времени и до 11% памяти, хотя препринт не рецензирован и числа получены самими авторами. Для команд это способ подтвердить происхождение весов и использование данных, но не доказательство качества готовой модели.

Свидетельство связывает данные, параметры и каждый шаг обучения

Систему предложили Houjun Liu и Pratyusha Sharma из Stanford University и New York University. Вместо контрольных точек, по которым аудитор заново выполняет значительную часть обучения, Witnesses записывает подписанную цепочку свидетельств. Новая запись зависит от предыдущей, поэтому шаг нельзя незаметно заменить или удалить задним числом.

На каждом обновлении система фиксирует компактные отпечатки параметров модели и состояния оптимизатора до и после шага. В ту же запись входит хэш пакета обучающих данных. Получается связанная история: какие данные поступили на вход, как должен был сработать заявленный алгоритм и к какому состоянию он привёл модель.

Полное сохранение весов после каждого обновления сделало бы свидетельство слишком большим. Поэтому Witnesses проецирует матрицы весов на заранее выбранные ортонормированные направления и сворачивает результат в единый хэш. Такая проекция оставляет мало места для локальной подмены: изменение либо проявится в отпечатке, либо затронет много параметров и повысит вероятность обнаружения при повторной проверке шага.

Отпечаток состояния оптимизатора подтверждает непрерывность между соседними обновлениями. Для данных система сочетает криптографический хэш с быстрым скользящим хэшем. Аудитор может проверить, встречался ли конкретный образец в обучении, не получая весь журнал и детали процедуры.

Редкие повторы заменяют воспроизведение всего запуска

Одних отпечатков недостаточно: корректная цепочка могла бы описывать вычисление, которое на самом деле не выполнялось. Поэтому система случайно выбирает отдельные обновления и повторяет их. Тренер заранее не знает, какой шаг попадёт под проверку, а результат повтора должен совпасть с записанными состояниями.

Вероятность пропустить подмену уменьшается по мере роста числа проверок. В экспериментах система обнаруживала атаки с заменой обучающих данных почти наверняка, проверяя 1% переходов. Она также находила случайное повреждение параметров и изменения, специально оптимизированные против открытого алгоритма отпечатка.

На распределённом обучении моделей от 100M до 2B параметров Witnesses увеличил время шага не более чем на 19%, а занятую память — не более чем на 11%. Проверяли GPT-подобные модели с DDP, где состояние реплицируется между ускорителями, и FSDP, где параметры и состояние разделены между ними. Выигрыш особенно заметен в конфигурациях, где запись свидетельства удаётся совместить по времени с обменом данными между ускорителями.

Сертификат растёт вместе с обучением, но аудитору не нужно держать его целиком в памяти: записи можно проверять потоком. Это переносит основную работу на команду, которая обучает модель, а проверяющей стороне оставляет хэширование, выборочные повторы и проверку подписей.

Планы меняются только у команд, которые контролируют обучение

Witnesses имеет смысл закладывать в инфраструктуру до запуска: свидетельство строится при каждом обновлении, а не восстанавливается по готовым весам. Такой слой пригодится командам, которые публикуют исследовательские результаты, сравнивают собственные архитектуры или должны подтвердить, что тестовые примеры не попали в обучение.

В полностью открытом режиме проверяющая сторона получает начальное состояние, модель и обучающие данные. Тогда можно подтверждать как включение образца, так и его исключение. Для открытых весов гарантии уже: система защищает от скрытого добавления данных, но не даёт тот же набор проверок, что при раскрытом обучении.

Сертификат доказывает согласованность запуска с заявленной функцией обновления и записанными данными. Он не оценивает полезность модели, корректность выбранного датасета или безопасность ответов. Для продукта, который только вызывает чужую модель через API, этот механизм также не создаёт новых гарантий: его должен применять владелец обучающего контура.

Практическая реализация опирается на отдельный модуль аттестации с обфусцированной виртуальной машиной. Модель угроз предполагает, что тренер не может подделать её поведение, извлечь код или изменить его, сохранив действительную цепочку. Поэтому Witnesses сокращает объём доверия, но не устраняет его: перед внедрением придётся оценить не только накладные расходы, но и приемлемость этой границы безопасности.

Источники

Иллюстрация: рисунок из статьи «Training Witnesses: Trusting the Training without Trusting the Trainer», Houjun Liu, Pratyusha Sharma, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу