Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Малые языковые модели научили передавать друг другу полезную часть решения, не превращая рассуждение в общий спор. В препринте, который не прошёл рецензирование и где все числа получили сами авторы, три агента достигли точности голосования по 32 независимым ответам. Для систем, которые масштабируют качество повторными запусками одной модели, это предлагает другой путь: обучать обмен подсказками, а не только увеличивать число попыток.
Как сеть решает, кому говорить и кого слушать
Самосогласование (self-consistency) запускает модель несколько раз и выбирает самый частый ответ. Такой подход помогает, пока независимые попытки находят разные решения, но затем голосование сходится к ответу, который модель и без того выдаёт чаще всего. Если этот ответ систематически неверен, дополнительные запуски уже мало что меняют.
Mehmet Kerem Turkcan предложил TalkMesh — разреженную сеть агентов на одной или нескольких малых моделях. Каждый агент сначала независимо решает задачу. Базовая модель при этом заморожена, поэтому обучение коммуникации не меняет качество одиночного ответа.
К модели подключены два обучаемых адаптера. Первый служит модулем уверенности: он оценивает готовое решение по шкале между неправильным и правильным. Второй пишет подсказки и исправленные ответы.
Агент с наивысшей оценкой становится говорящим и отправляет остальным ключевую идею, критический шаг и итоговый ответ. Подсказка занимает не больше 112 токенов. Пересматривают решения только агенты с низкой уверенностью, а новая версия заменяет исходную лишь тогда, когда модуль уверенности оценивает её выше.
Так TalkMesh сохраняет часть независимых ответов вместо того, чтобы заставлять всю сеть повторять одну цепочку рассуждений. Финальный вариант выбирает взвешенное голосование: больший вес получают решения, которые модуль уверенности считает надёжнее.
Центральный координатор для этого не нужен. Соседние агенты обмениваются локальными таблицами ответов и постепенно приходят к тому же результату, что и централизованное взвешенное голосование. Такой протокол подходит для разреженной сети, где каждый узел общается только с ближайшими соседями.
Политику общения обучают алгоритмом GRPO, который сравнивает несколько подсказок для одной задачи. Исправление получает положительную награду, если превращает неверный ответ в правильный, и отрицательную — за обратную ошибку. Подсказку оценивают по тому, насколько она помогла всем слушателям, поэтому модель учится передавать полезный шаг, а не просто уверенно повторять итог.
Обученная подсказка обошла голосование и выдержала сговор
На GSM8K обученная коммуникация прибавила 13,7 процентного пункта к точности простого голосования для младшей Qwen3.5. На MATH-500 прибавка для SmolLM3-3B составила 23 пункта. Политика, которая писала подсказки без специального обучения, и одно лишь взвешивание по уверенности дали меньший результат.
Обучение на небольших сетях переносилось на более крупные. Политика проходила программу с постепенным ростом числа агентов, а затем сохраняла преимущество при масштабе, которого не встречала во время обучения. Фиксированное обучение без такой программы переставало обгонять базовый подход при дальнейшем росте сети.
Отдельный эксперимент проверял сговор: половина из восьми агентов отправляла общий неправильный ответ, заявляла поддельную уверенность и рассылала отравленную подсказку. Простое большинство не решило ни одной задачи, тогда как защищённая сеть сохранила точность 50,7% на GSM8K.
Защита опиралась не на поиск злоумышленника, а на два локальных правила. Каждый агент самостоятельно переоценивал чужое решение своим модулем уверенности, а исправление принимал только после повторной проверки. Следовательно, заявленная отправителем уверенность сама по себе не влияла на выбор говорящего и вес ответа.
Когда TalkMesh меняет архитектурный план
Главный критерий — разница в доступной информации. Коммуникация помогала, когда один агент не видел нужный факт, а другой мог его передать. В математических задачах таким фактом становился пропущенный шаг решения; в управлении светофорами — сообщение об аварии, которую наблюдал только соседний перекрёсток.
Когда каждый агент уже видел всё необходимое для собственного действия, сообщения не улучшали результат сверх погрешности. Поэтому TalkMesh не даёт общего основания заменять одиночный вызов модели многоагентной системой. Он предлагает альтернативу именно повторной генерации и сценариям с распределённым контекстом.
Проверки рассуждений охватили модели Qwen3.5, Qwen3 и SmolLM3 размером от 0,8 до 4 млрд параметров, задачи GSM8K и числовую часть MATH-500. Дополнительные эксперименты использовали SwarmBench и симуляцию городских светофоров. Во всех случаях результат можно было автоматически проверить, а для обучения были доступны правильные ответы, награды или трассы контроллера.
Это сужает практическую область метода. Команде нужен собственный модуль оценки, обученный на примерах из целевой области, иначе сеть не сможет надёжно выбрать говорящего и отфильтровать вредное исправление. Для открытых задач без проверяемого результата работа пока не показывает аналогичного механизма.
Архитектурно полезны три решения: сохранять независимость исходных попыток, проверять чужую уверенность локально и награждать сообщение за исправленные действия получателей. Их можно перенести в систему с разными моделями: в опытах агенты использовали собственные модули оценки и общения без общего центрального судьи.
Работа сравнивает точность и число ответов, но не даёт основания оценить производственную задержку и стоимость такой сети. Поэтому она меняет план эксперимента, а не сразу выбор инфраструктуры: вместо десятков независимых запусков стоит проверить малую сеть с обученной подсказкой и измерить полный бюджет вычислений на своей нагрузке.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



