Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Anthropic представила три метрики, которые показывают, как лаборатория разрабатывает следующие поколения моделей. Их можно использовать при оценке поставщика: они описывают зависимость исследований от ИИ, качество внутренних мер контроля и приоритеты в использовании вычислительных ресурсов.
Первая метрика — доля исследований и разработки, которую выполняет ИИ. Чем активнее модели участвуют в создании следующих версий, тем важнее понимать, успевают ли процессы проверки за темпом изменений.
Вторая метрика оценивает, насколько хорошо люди контролируют ИИ-агентов. Она относится к риску, что агент выполнит много связанных действий до того, как оператор заметит ошибку или отклонение от задачи.
Третья показывает, как лаборатория распределяет вычислительные ресурсы. Вместе метрики позволяют анализировать не только готовый продукт, но и процесс его создания. Anthropic утверждает, что другие разработчики передовых моделей могут публиковать такие же показатели, а независимые организации — проверять их.
В исходном посте нет значений метрик и методики расчёта, поэтому пока это рамка для сравнения поставщиков, а не готовая оценка Anthropic.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



