Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Заранее построенный вектор плохо показывает, означают ли две похожие фразы одно и то же. В нерецензированном препринте Jiaqi Deng приводит собственные замеры: совместная обработка дала площадь под ROC-кривой 0,90–0,96, а специализированные кодировщики — 0,55–0,70 при случайном результате 0,5. Для RAG это аргумент разделить быстрый поиск кандидатов и проверку точного смыслового совпадения.
Фразы сначала кодировали независимо и сравнивали по косинусной близости. Затем обе фразы подавали в модель за один проход, а линейный классификатор считывал ответ из внутреннего состояния последнего токена. Простое объединение двух независимо полученных векторов почти не помогло, а после перемешивания вторых фраз результат совместного прохода падал до случайного уровня.
Разрыв означает, что модель вычисляет отношение между фразами, когда видит их вместе. Оно не лежит в готовых векторах в форме, которую можно извлечь косинусом или линейным слоем. Нелинейные модели над независимыми представлениями восстанавливали часть сигнала, но требовали заметно больше размеченных пар, чем классификатор над совместным проходом.
Основной тест проводили на PAWS-X с выровненным лексическим пересечением: правильные и неправильные пары содержали сопоставимое количество одинаковых слов. Проверка охватила Llama 3, Mistral, Qwen, специализированные кодировщики, двунаправленные модели и модели с кодировщиком и декодировщиком. Для современных моделей от 1,5 до 32 млрд параметров знак разрыва сохранялся; содержание вывода ограничено прежде всего парами в стиле PAWS, где похожие слова маскируют разный смысл.
В моделировании FAQ-поиска индекс BGE по-прежнему находил кандидатов, а совместная проверка исправляла ошибки на почти одинаковых формулировках: доля верных первых результатов выросла с 0,47 до 0,88. Практическая схема не требует отказываться от векторного индекса: он отвечает за охват, после чего отдельная модель читает запрос и каждый лучший кандидат вместе. Такой второй этап стоит закладывать в архитектуру, если продукт должен различать перефразы и смысловые ловушки, а не только находить тексты на одну тему.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



