Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Авторы представили GPS-Bench — набор задач для оценки автоматизированного анализа государственной политики — в препринте, который не проходил рецензирования. По их замерам, дообучение весов лучше всего предсказывает последствия для участников, а разделение рассуждения между агентами его не превосходит. Работа важна командам, которые выбирают между одной LLM, графовой системой и многоагентной архитектурой для анализа регулирующих мер.
Что сделали
GPS-Bench связывает политические меры с затронутыми сторонами, их действиями и последующими эффектами. Исходные состояния участников восстанавливаются по датированным законодательным материалам, сведениям о лоббировании, документам регуляторов, корпоративной отчётности и экономическим данным. Для каждой меры система отделяет сведения, доступные до момента решения, от событий, которые должна предсказать.
Все проверяемые режимы получают одно состояние в виде временного графа и возвращают результат по общей схеме. Авторы сопоставили совместное рассуждение одной модели, независимых агентов, агентов с обменом сообщениями, графовые методы и дообучение весов. Оценивались принятие меры, определение затронутых участников и направление эффекта для каждого из них.
Корпус содержит 1 233 политических инструмента. Основной набор Gold включает 679 случаев, размеченных людьми; ещё 4 235 записей Silver, размеченных отдельной LLM по найденным свидетельствам, разрешено использовать для обучения, но не как тестовые ответы. По результатам авторов, дообучение на материалах корпуса оказалось сильнее подходов без изменения весов на задачах уровня участников. Многоагентность не повысила точность относительно него, но сделала явными переговоры, предложения и формирование коалиций.
Что это значит
Работа не даёт оснований выбирать многоагентную систему только ради качества прогноза. Для структурированного результата достаточно рассматривать одну дообученную модель как базовый вариант, а агентов добавлять, если требуется показать разные позиции, частные свидетельства и механизм согласования действий. Временной граф при этом полезен независимо от режима: он фиксирует происхождение фактов и границу между входными данными и прогнозом.
Ограничения. Проверка проведена на ретроспективном корпусе государственных мер, причём обучение отделено от теста временной границей 2024 года. Работа оценивает только принятие меры, состав затронутых сторон и направление эффекта; предсказанные действия, промежуточные механизмы и изменения состояния мира не получают количественной оценки. Поэтому GPS-Bench не показывает качество полных причинных сценариев и перенос результатов на другие виды организационных решений. В сравнении также не учтены стоимость и задержка режимов, хотя многоагентное взаимодействие требует дополнительных вызовов модели.
Источники
Иллюстрация: рисунок из статьи «GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis», Linh Le, Melanie Bui, My Chiffon Nguyen и др., CC BY-SA 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



