Журнал · Rit.work

Короткие тесты рассуждений скрывают провал GPT-5 на длинных регламентах

В тесте TAM GPT-5 точно выполнил лишь 1% задач медицинского кодирования и 15,5% расчётов по федеральным правилам назначения наказаний.

Rit.work
Студия разработки
14 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

GPT-5 почти не справился с задачами, где нужно пройти длинный профессиональный регламент и выдать точный итог. В работе Manulife, которая не прошла рецензирование и содержит замеры самих авторов, лучший результат составил 1% для медицинского кодирования и 15,5% для расчёта уровня федерального наказания в США. Высокая оценка на коротком тесте рассуждений поэтому не подтверждает, что модель сможет вести производственный процесс без отдельного контроля правил и промежуточных решений.

Новый бенчмарк TAM проверяет не отдельный поиск факта, а выполнение всей процедуры. Модель должна переходить между разделами руководства, учитывать исключения, возвращаться к ранним решениям и собирать точный ответ; любое лишнее или пропущенное значение делает результат неверным.

GPT-5 получал доступ к одним и тем же руководствам четырьмя способами: через однократный поиск с генерацией ответа, итеративный агентный поиск, ReAct с инструментами и агентную систему, которая распределяла этапы между отдельными исполнителями. Разбиение работы не решило проблему: на медицинских случаях точное совпадение осталось не выше 1%.

Модель часто находила подходящие правила, но не удерживала согласованность всей цепочки. В 38 из 50 изученных ошибочных траекторий ReAct первое заметное отклонение вело к глобально неверному решению: система рано выбирала не ту ветку руководства, а затем последовательно и правдоподобно продолжала ошибочный расчёт.

Проверка охватывает две области с формализованным результатом: 1 000 случаев кодирования по ICD-10-CM и 200 задач по федеральным правилам назначения наказаний. Сравнивали только GPT-5 и способы работы с подсказками, поиском и инструментами, а не обученные под конкретную область системы. Для продуктовой архитектуры результат очерчивает границу RAG: доступ к регламенту ещё не превращает LLM в надёжного исполнителя, поэтому состояние процесса, обязательные проверки и возврат к ранним шагам придётся задавать отдельно.

Источники

Иллюстрация: рисунок из статьи «Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models», Utkarsh Soni, Syed Shariyar Murtaza, Yifan Nie и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу