Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Задачи над длинным корпусом становятся тем труднее, чем быстрее растёт число нужных сравнений между документами. В нерецензированном препринте команда UC Berkeley приводит собственные замеры: при росте контекста средний результат на сложных задачах снизился на 40%, а на обычных — на 13%. Поэтому успешный поиск фактов ещё не доказывает, что модель справится с выявлением всех противоречий или связей в том же массиве.
Авторы ввели сложность корпусной задачи (CTC) — показатель того, как растёт минимальное число операций при увеличении корпуса. Для поиска одного факта достаточно проверить каждый документ один раз. Чтобы найти все противоречия, приходится сопоставлять пары: для 100 документов возможны 4 950 сравнений. Есть и задачи, где нужно перебирать тройки документов.
Для проверки собрали CTC-Bench из 22 задач: поиск и ранжирование дополнили выявлением противоречий, восстановлением порядка фрагментов, группировкой текстов и поиском редких тем. Qwen3.5-4B отдельно дообучали на каждой задаче и тестировали с контекстом от 2 до 32 тысяч токенов. Блочно-разреженное внимание почти не уступало полному на задачах с линейным ростом сложности, но сильнее теряло качество там, где число сравнений росло квадратично или быстрее.
Основные эксперименты провели на одной модели, а повторную проверку разных семейств и размеров ограничили поиском по HotpotQA и выявлением противоречий. Часть задач синтетическая или полусинтетическая, хотя по структуре они повторяют реальные сценарии. Для продукта вывод прикладной: если система должна не найти отдельный факт, а сопоставить весь корпус, её нужно проверять на растущем числе документов и междокументных связей. Результат на обычном бенчмарке длинного контекста не подтверждает, что более дешёвый механизм внимания сохранит качество.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



