Журнал · Rit.work

Длинный контекст скрывает сложность работы с корпусом

CTC-Bench показывает, почему поиск факта и выявление всех противоречий по-разному нагружают модель при росте корпуса и требуют разных архитектурных решений.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Задачи над длинным корпусом становятся тем труднее, чем быстрее растёт число нужных сравнений между документами. В нерецензированном препринте команда UC Berkeley приводит собственные замеры: при росте контекста средний результат на сложных задачах снизился на 40%, а на обычных — на 13%. Поэтому успешный поиск фактов ещё не доказывает, что модель справится с выявлением всех противоречий или связей в том же массиве.

Авторы ввели сложность корпусной задачи (CTC) — показатель того, как растёт минимальное число операций при увеличении корпуса. Для поиска одного факта достаточно проверить каждый документ один раз. Чтобы найти все противоречия, приходится сопоставлять пары: для 100 документов возможны 4 950 сравнений. Есть и задачи, где нужно перебирать тройки документов.

Для проверки собрали CTC-Bench из 22 задач: поиск и ранжирование дополнили выявлением противоречий, восстановлением порядка фрагментов, группировкой текстов и поиском редких тем. Qwen3.5-4B отдельно дообучали на каждой задаче и тестировали с контекстом от 2 до 32 тысяч токенов. Блочно-разреженное внимание почти не уступало полному на задачах с линейным ростом сложности, но сильнее теряло качество там, где число сравнений росло квадратично или быстрее.

Основные эксперименты провели на одной модели, а повторную проверку разных семейств и размеров ограничили поиском по HotpotQA и выявлением противоречий. Часть задач синтетическая или полусинтетическая, хотя по структуре они повторяют реальные сценарии. Для продукта вывод прикладной: если система должна не найти отдельный факт, а сопоставить весь корпус, её нужно проверять на растущем числе документов и междокументных связей. Результат на обычном бенчмарке длинного контекста не подтверждает, что более дешёвый механизм внимания сохранит качество.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу