Журнал · Rit.work

Бенчмарки ошибок аргументации путают форму рассуждения с ошибкой

Низкая доля ложных срабатываний в fallacy-бенчмарках не показывает, умеет ли модель отличать ошибочное рассуждение от корректного с той же схемой.

Rit.work
Студия разработки
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Проверка показала, что низкая доля ложных срабатываний в бенчмарках ошибок аргументации возникает из-за состава тестовых данных, а не из-за способности моделей понимать рассуждения. В работе IIIT Naya Raipur, которая не прошла рецензирование и содержит замеры самих авторов, на CoCoLoFa этот показатель вырос с 16,6% до 58,9% после замены штатных корректных примеров на содержательно близкие. Поэтому обычная метрика может создать ложное впечатление, что детектор готов к работе с реальными аргументами.

Бенчмарки объединяют все не отмеченные как ошибочные тексты в один класс «корректно» или «нет ошибки». Туда попадают мнения, фрагменты, посторонние замечания и рассуждения других типов. Модели достаточно распознать схему аргументации — повторяемый способ связать доводы с выводом, — хотя она не проверяет, применена ли эта схема корректно.

Для проверки создали Scheme Foils: корректные аргументы на ту же тему, сходной длины и в том же стиле. Один вариант сохранял схему исходной ошибки, но устранял саму ошибку; контрольный вариант использовал другую схему. Примеры написал Gemini 2.5 Flash, отфильтровал DeepSeek, а основную проверку провели на ModernBERT-base, обученном классифицировать типы ошибок.

Корректные аргументы с совпадающей схемой модель относила к исходному типу ошибки на 40,9 процентного пункта чаще, чем контрольные. Эффект повторился на Reddit и в детекторах на базе LLM, которым не показывали эти бенчмарки при обучении. Это указывает на подмену задачи: классификатор узнаёт форму рассуждения, но не устанавливает, нарушено ли условие его корректности.

Основные эксперименты охватывают восемь типов ошибок в CoCoLoFa и Reddit; состав штатного корректного класса дополнительно изучали в Argotario и MAFALDA. Полученные на специально созданных примерах доли нельзя переносить на рабочий поток как прогноз. Но перед выбором модели или бенчмарка стоит проверить, содержит ли отрицательный класс корректные аргументы с теми же схемами: без них низкая доля ложных срабатываний не подтверждает качество детектора.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу