Журнал · Rit.work

Почему поиск по эмбеддингам путает смысл с формой

Авторы проверили структурный поиск на математических задачах и траекториях агентов: нужный объект часто попадает в список кандидатов, но уступает тексту с похожими словами.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Nabira Rashid и Manolis Kellis проверили, способен ли поиск по эмбеддингам находить одинаковую структуру при разной формулировке; их работа — препринт, не проходивший рецензирования. В самом сложном варианте математического теста авторы измерили 0% правильных результатов на первой позиции. Работа важна командам, которые строят RAG-системы, память агентов и поиск по аналогичным задачам.

Что сделали

Авторы исследовали структурный поиск в двух несвязанных областях. Первая — олимпиадные математические задачи: для 500 запросов система искала исходную задачу в корпусе из 117 088 документов. Формулировку запроса меняли, сохраняя способ решения, а рядом помещали ловушки с похожим текстом, но другой математической структурой.

Вторая область — траектории агентов в ALFWorld. Здесь использовали 118 запросов и 336 последовательностей действий. Правильным считался сценарий того же типа, но с другими предметами или местами назначения. Например, агент должен был перенести не тот же предмет в ту же ёмкость, а выполнить аналогичную процедуру над другими объектами.

Сначала модели эмбеддингов ранжировали весь корпус по косинусной близости — сходству между числовыми представлениями текстов. Затем несколько моделей-оценщиков повторно сортировали фиксированный список top-10, то есть десять лучших кандидатов первого этапа. Отдельный лексический переранжировщик учитывал только совпадения слов, редакционное расстояние и близость длины текстов. Он служил контрольным тестом: добавлял поверхностное сходство, но не мог рассуждать о структуре.

Что показали

На сложных математических переформулировках обе основные модели эмбеддингов ни разу не поставили исходную задачу на первое место. При этом правильный документ часто уже находился внутри top-10. По интерпретации авторов, проблема возникала не на этапе извлечения кандидатов, а при определении их порядка: выигрывала задача с похожими словами, хотя способ решения отличался.

В ALFWorld авторы обнаружили сходный поведенческий результат. Когда правильная траектория должна была отличаться и предметом, и местом назначения, модели работали хуже случайного выбора. Буквальные названия объектов оказывались сильнее сходства процедур.

Переранжирование с помощью модели-оценщика вернуло 5–63% доступного улучшения в математике и 43–76% в траекториях. Направление эффекта сохранялось между использованными оценщиками, но его величина, реакция на сложность переформулировки и относительный порядок моделей менялись. Поэтому результат одного оценщика нельзя переносить на другой домен или даже на другой стиль запроса.

Лексический контроль закрыл 26–36% доступного разрыва в траекториях, но ухудшил математический поиск. Авторы связывают различие с устройством тестов. В математике совпадение слов было специально превращено в ловушку, а в траекториях возникало естественно и частично указывало на тип процедуры. Следовательно, знак эффекта лексического контроля характеризует не только поисковую модель, но и конструкцию набора данных.

Ограничения

Работа не показывает, что поиск по эмбеддингам в целом неработоспособен. Авторы проверяли узкую ситуацию, где формулировка и структура намеренно расходятся. Математический набор использует сгенерированные переформулировки и примеры-ловушки, поэтому измеряет устойчивость к конкретному способу маскировки. Траектории относятся к одному семейству данных и ограниченному набору типов бытовых задач.

Сравнение охватывает несколько моделей эмбеддингов, моделей-оценщиков и простой лексический контроль, но не включает специально обученный структурный поисковик или переранжировщик. Поэтому работа не отвечает, можно ли устранить смещение обучением на структурных парах, а не добавлением общей LLM после поиска.

В математической части авторы также нашли признаки возможного запоминания известных соревнований моделью-оценщиком, но дизайн эксперимента не позволяет отделить память от рассуждения. Проверка влияния поиска на конечное решение проведена с одним решателем, у которого почти не оставалось пространства для улучшения: завершённые ответы и без дополнительного контекста обычно были правильными, а ошибки во многом совпадали с обрывом генерации. Из этого опыта нельзя делать общий вывод о пользе RAG для математических систем.

Что это значит

Работа не требует менять базовую архитектуру систем, где сначала получают кандидатов по эмбеддингам, а затем уточняют порядок. Она меняет критерии приёмки такой архитектуры. Обычный тест, в котором релевантный документ повторяет слова запроса, может подтвердить способность находить тему, но ничего не сказать о поиске процедур, причинных схем или способов решения.

Командам, которые строят на таком поиске, стоит разделять извлечение и ранжирование в метриках. Если правильный объект уже присутствует среди кандидатов, замена модели эмбеддингов может дать меньше пользы, чем отдельный переранжировщик. Но выбирать его по одному публичному тесту рискованно: по замерам авторов результат зависит от модели-оценщика, формулировки инструкции, домена и происхождения данных.

В собственный набор проверки полезно включать пары двух типов: одинаковая структура при разных словах и похожий текст при разной структуре. Лексический контроль здесь становится дешёвой диагностикой. Если он улучшает результат, набор, вероятно, всё ещё позволяет выигрывать за счёт слов; если ухудшает — поверхностное сходство конфликтует с целевой релевантностью.

Для планов разработки вывод локальный: переранжирование стоит закладывать как отдельный проверяемый этап, когда продукт ищет аналогичные процессы, решения или траектории, а не просто документы на одну тему. Переезд на другую модель эмбеддингов без структурного теста не подтверждает, что система стала лучше понимать задачу.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу