Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Результаты LLM на разных задачах не складываются в одну понятную шкалу общего интеллекта. Команда из KAIST и независимый исследователь получили этот результат в препринте, который не прошёл рецензирование и содержит их собственные расчёты: даже при самом благоприятном способе обработки единый фактор объяснил 70,8% разброса результатов, а в большинстве вариантов — меньше этого уровня. Поэтому рост на одном «интеллектуальном» бенчмарке сам по себе не обещает переноса на код, работу с инструментами или другие задачи.
Авторы применили факторный анализ: он ищет несколько скрытых переменных, которые совместно описывают связи между оценками. Если один общий фактор действительно лежит в основе разных способностей, бенчмарки должны устойчиво зависеть от него, а тесты на близкие навыки — собираться в понятные группы.
Этого не произошло. Бенчмарки с похожим содержанием часто оказывались далеко друг от друга, а тесты с самой сильной связью с общим фактором не объединяла общая тема. Привычные проверки математики, рассуждений и знаний тоже не стали надёжными заменителями единой шкалы интеллекта.
Анализ охватил 13 251 опубликованную оценку для 1 618 моделей и 456 текстовых бенчмарков. В исходной таблице были заполнены только 1,8% сочетаний модели и теста, поэтому исследователи несколькими способами отбирали более плотные фрагменты и восстанавливали пропуски. Основной вывод повторялся при разных вариантах обработки. Работа касается генеративных языковых моделей и текстовых задач; разные размеры и поколения одной семьи в части расчётов объединяли.
Для продуктовой оценки это аргумент против стратегии с одним сводным баллом. Такой балл помогает ранжировать модели, но не доказывает, что команда улучшает отдельную способность, которая затем переносится на весь продукт. Практичнее собирать набор проверок вокруг реальных сценариев и отдельно измерять перенос: например, сравнить качество кода до и после дополнительного обучения на математике.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



