Журнал · Rit.work

Команда LLM-агентов упирается в способ выбора ответа

Повторные вызовы одной LLM дают больше правильных вариантов, но голосование и усреднение часто закрепляют общую ошибку вместо роста точности.

Rit.work
Студия разработки
28 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Большая команда копий одной LLM почти не улучшает итоговый ответ, хотя среди её вариантов чаще встречается правильный. В препринте Carolina Fortuna и Blaz Bertalanic, который не проходил рецензирование и содержит замеры самих авторов, доля заданий хотя бы с одним правильным ответом выросла на 5–20 процентных пунктов, но обычное голосование почти не использовало этот запас. Значит, дополнительные вызовы модели окупаются только вместе с механизмом, который умеет распознать удачный вариант.

Авторы разделили задачи по способу собрать командный результат. В задачах с одним правильным решением достаточно, чтобы его нашёл хотя бы один агент, но затем система должна выбрать именно его. В задачах с численной оценкой, таких как Fermi estimation, результат получают усреднением ответов в расчёте на то, что случайные ошибки погасят друг друга.

При прямых ответах голосование усиливало самый частый вариант модели, а не выбирало любой правильный из набора. Расчёт на основе распределения ответов предсказывал результат голосования со средней ошибкой не более 0,5 процентного пункта. Ревизия повышала точность, однако прибавка оказалась почти одинаковой при одном чужом ответе и при ответах 29 собеседников: основную пользу давала возможность пересмотреть решение, а не размер команды.

Усреднение численных оценок тоже быстро упиралось в потолок. Систематическое смещение на уровне конкретного задания давало около 87% квадратичной ошибки, поэтому дополнительные ответы одной модели сокращали ошибку лишь примерно на 6%. Если модель раз за разом ошибается в одну сторону, среднее значение сохраняет эту ошибку.

Результаты получили на 13 моделях с открытыми весами не крупнее 20B параметров, на задачах по математике, знаниям, естественным наукам и RealFP. Команды включали до 30 агентов; промпт требовал сначала назвать ответ, а затем объяснить его, а ревизию проверяли только с чужими ответами. Для архитектуры продукта вывод практический: бюджет лучше направлять не на одинаковых агентов, а на проверку кандидатов, пересмотр решения или сочетание моделей с разными ошибками.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу