Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Авторы из Seoul National University и Snowflake AI Research представили ArcticSwarm для многоагентного исследования; работа опубликована как препринт, не проходивший рецензирования. В сопоставимом испытании система опередила MiroFlow на 12 процентных пунктов по доле правильных ответов. Результат важен командам, которые строят поиск по документам и интернету с несколькими LLM-агентами, но не имеют надёжного автоматического проверяющего.
Что сделали
Авторы исследуют раннее согласие между агентами. Оно возникает, когда первый правдоподобный кандидат попадает в общий контекст и начинает определять дальнейшие запросы. Формально агенты продолжают работать параллельно, но фактически ищут подтверждения одной гипотезы и реже проверяют альтернативы.
ArcticSwarm разделяет сбор свидетельств и их объединение. Оркестратор разбивает исходный вопрос на задачи, назначает их поисковым или рассуждающим агентам и выбирает для каждой задачи режим доступа к общей доске. Агент в режиме сотрудничества может читать и публиковать записи. Изолированный агент видит исходную задачу и собственную историю, публикует результат, но во время поиска не читает выводы коллег.
Ограничение действует на уровне отдельной задачи, а не всего агента или этапа процесса. Один исполнитель может независимо проверить альтернативу, а в следующей задаче перейти к совместному разбору уже собранных материалов. Это позволяет сохранить обмен фактами, не превращая раннюю догадку в общую предпосылку.
Второй элемент архитектуры — проверка перед тремя границами фиксации решения: завершением локального поиска, публикацией общей гипотезы и выдачей окончательного ответа. Проверяющие выносят структурированный вердикт: указывают неподтверждённое условие, предлагают альтернативу либо подтверждают кандидата конкретным свидетельством. Перед ответом оркестратор требует проверку от завершившего поиск исполнителя и отдельного рецензента, а также запуск поиска альтернативного кандидата. Если условия не выполнены, система создаёт дополнительные задачи.
Что показали
Основной контролируемый эксперимент авторы провели на BrowseComp-Plus с открытой моделью Qwen 3.5-27B. ArcticSwarm получила 82,6% правильных ответов. При отключении изоляции результат снизился до 78,8%, а после дополнительного отключения структурированной проверки — до 74,5%. Сопоставимый повторный запуск MiroFlow на тех же инструментах, ограничениях и модели дал 70,6%.
Такое поэтапное отключение компонентов важнее простого сравнения двух систем: по замерам авторов, вклад дают и ограничение чтения чужих гипотез, и проверка перед фиксацией решения. Анализ поисковых маршрутов также показывает, что изоляция уменьшает пересечение найденных документов. Это согласуется с заявленным механизмом, хотя само по себе не доказывает, что агенты формируют независимые представления.
В отдельном испытании на BrowseComp с поиском в действующем интернете ArcticSwarm и GPT-5 достигли 73,6%. Авторы сопоставляют этот результат с другими исследовательскими системами, но условия этого расширения контролировались слабее, чем в основном эксперименте.
Ограничения
Основной контролируемый результат получен на всех 830 вопросах BrowseComp-Plus по корпусу примерно из 100 тысяч заранее отобранных документов. Это задачи на поиск сущности по нескольким условиям, а не проверка производственного процесса с меняющимися источниками, правами доступа, внутренними базами и требованиями к аудиту. Правильность определяла модель-оценщик GPT-4.1, поэтому измеряется совпадение с эталонным ответом по правилам бенчмарка, а не полезность исследовательского отчёта для человека.
Расширение на действующий интернет охватывает 1266 заданий BrowseComp, но в работе прямо указано, что бюджеты закрытых моделей и систем поставщиков не были выровнены. Поэтому такое сравнение хуже отделяет влияние архитектуры от различий в моделях, поисковых службах и вычислительных лимитах. Наиболее содержательным остаётся сопоставление с MiroFlow в общем испытательном контуре.
Работа не показывает, сохранится ли преимущество на корпоративных документах, в аналитике с неоднозначным итогом или в задачах, где ответ должен пройти проверку специалиста. В ней также нет производственного сравнения стоимости, задержки и сложности эксплуатации с более простой схемой из одного агента. Без такого сравнения прирост точности нельзя автоматически считать экономически оправданным.
Что это значит
Для команд, уже проектирующих многоагентный исследовательский контур, работа меняет планы на уровне координации, а не выбора базовой модели. Общая память не должна автоматически становиться общим контекстом каждого исполнителя. Полезно отдельно определить право публиковать сведения, право читать чужие гипотезы и момент, когда кандидат считается достаточно проверенным для распространения.
Практическая схема следует из устройства ArcticSwarm: независимые поисковые ветки получают закрытый контекст, результаты записываются в структурированное хранилище, а объединение начинается после появления альтернатив. Перед окончательным ответом отдельный проверяющий должен связать каждое условие задачи с источником и вернуть поиск на предыдущий этап, если подтверждения недостаточно.
Полностью перестраивать работающую систему только по этим результатам рано. Разумный следующий шаг — добавить управляемую изоляцию и точки проверки как переключаемые режимы, затем сравнить их на собственных заданиях по качеству, расходу токенов, задержке и числу запросов к инструментам. Если агенты сейчас читают общий журнал с начала выполнения, такая проверка приоритетнее увеличения их количества: работа авторов показывает, что дополнительный параллелизм не гарантирует разнообразия поиска.
Источники
Иллюстрация: рисунок из статьи «ArcticSwarm: Deferring Early Consensus in Long-Horizon Multi-Agent Research», Soyoung Yoon, Boyi Liu, Yite Wang и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



