Журнал · Rit.work

Forecast-Dojo превращает прошлые события в полигон для LLM-прогнозистов

Forecast-Dojo позволяет сравнивать и обучать LLM-агентов на одинаковых исторических срезах новостей, но даже лучшие модели пока уступают прогнозам рынка.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Прогнозирующих LLM-агентов теперь можно многократно обучать и проверять на уже завершившихся событиях, не дожидаясь новых исходов. Команда Georgia Institute of Technology, Amazon и University of Florida представила Forecast-Dojo и в препринте, который не прошёл рецензирование, приводит собственные замеры: исследовательские инструменты улучшили прогнозы всех 12 проверенных моделей. Такая среда позволяет воспроизводить эксперимент при смене модели или настроек агента.

Forecast-Dojo объединяет 1 568 завершившихся событий Polymarket с 18,8 млн датированных новостей. Для каждого события среда задаёт несколько исторических точек: агент видит только материалы, опубликованные к соответствующей дате, ищет новости, читает статьи, запускает расчёты и выдаёт вероятности исходов. Затем среда открывает фактический результат и сразу оценивает прогноз, но во время работы агент его не видит.

На 230 отложенных событиях доступ к поиску и расчётам помог всем моделям. Средняя оценка Брайера, где меньшее значение означает более точные вероятности, снизилась с 0,670 в начале события до 0,606 ближе к его завершению. Без инструментов качество почти не менялось. Улучшения чаще приходились на этапы, между которыми появлялось больше новых свидетельств, поэтому среда проверяет не только итоговый ответ, но и способность агента обновлять прогноз.

Лучший результат модели составил 0,546 против 0,498 у исторических прогнозов рынка. Сравнение не полностью равное: участники рынка могли использовать сведения за пределами архива CC-News. Перенос записной книжки с выводами между датами сокращал медианные затраты на повторное исследование на 24%, но улучшил качество лишь у половины моделей. Проверка охватывает события Polymarket и новостной корпус за заданный исторический период; она показывает пригодность Forecast-Dojo для воспроизводимых испытаний и обучения, но не превосходство агентов над рынком.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу