Журнал · Rit.work

У LLM не нашлось понятной единой оси интеллекта

Анализ сотен текстовых бенчмарков показал, что общий фактор объясняет лишь часть результатов LLM и не совпадает с привычными тестами рассуждений.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Результаты LLM на разных задачах не складываются в одну понятную шкалу общего интеллекта. Команда из KAIST и независимый исследователь получили этот результат в препринте, который не прошёл рецензирование и содержит их собственные расчёты: даже при самом благоприятном способе обработки единый фактор объяснил 70,8% разброса результатов, а в большинстве вариантов — меньше этого уровня. Поэтому рост на одном «интеллектуальном» бенчмарке сам по себе не обещает переноса на код, работу с инструментами или другие задачи.

Авторы применили факторный анализ: он ищет несколько скрытых переменных, которые совместно описывают связи между оценками. Если один общий фактор действительно лежит в основе разных способностей, бенчмарки должны устойчиво зависеть от него, а тесты на близкие навыки — собираться в понятные группы.

Этого не произошло. Бенчмарки с похожим содержанием часто оказывались далеко друг от друга, а тесты с самой сильной связью с общим фактором не объединяла общая тема. Привычные проверки математики, рассуждений и знаний тоже не стали надёжными заменителями единой шкалы интеллекта.

Анализ охватил 13 251 опубликованную оценку для 1 618 моделей и 456 текстовых бенчмарков. В исходной таблице были заполнены только 1,8% сочетаний модели и теста, поэтому исследователи несколькими способами отбирали более плотные фрагменты и восстанавливали пропуски. Основной вывод повторялся при разных вариантах обработки. Работа касается генеративных языковых моделей и текстовых задач; разные размеры и поколения одной семьи в части расчётов объединяли.

Для продуктовой оценки это аргумент против стратегии с одним сводным баллом. Такой балл помогает ранжировать модели, но не доказывает, что команда улучшает отдельную способность, которая затем переносится на весь продукт. Практичнее собирать набор проверок вокруг реальных сценариев и отдельно измерять перенос: например, сравнить качество кода до и после дополнительного обучения на математике.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу