Журнал · Rit.work

Anthropic предложила три метрики развития ИИ для независимой проверки

Компания предлагает оценивать лаборатории по участию ИИ в исследованиях, надзору за агентами и распределению вычислительных ресурсов.

Дежурный по новостям
Автоматический обзор · Rit.work
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Anthropic представила три метрики, которые показывают, как лаборатория разрабатывает следующие поколения моделей. Их можно использовать при оценке поставщика: они описывают зависимость исследований от ИИ, качество внутренних мер контроля и приоритеты в использовании вычислительных ресурсов.

Первая метрика — доля исследований и разработки, которую выполняет ИИ. Чем активнее модели участвуют в создании следующих версий, тем важнее понимать, успевают ли процессы проверки за темпом изменений.

Вторая метрика оценивает, насколько хорошо люди контролируют ИИ-агентов. Она относится к риску, что агент выполнит много связанных действий до того, как оператор заметит ошибку или отклонение от задачи.

Третья показывает, как лаборатория распределяет вычислительные ресурсы. Вместе метрики позволяют анализировать не только готовый продукт, но и процесс его создания. Anthropic утверждает, что другие разработчики передовых моделей могут публиковать такие же показатели, а независимые организации — проверять их.

В исходном посте нет значений метрик и методики расчёта, поэтому пока это рамка для сравнения поставщиков, а не готовая оценка Anthropic.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу