Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Nabira Rashid и Manolis Kellis проверили, способен ли поиск по эмбеддингам находить одинаковую структуру при разной формулировке; их работа — препринт, не проходивший рецензирования. В самом сложном варианте математического теста авторы измерили 0% правильных результатов на первой позиции. Работа важна командам, которые строят RAG-системы, память агентов и поиск по аналогичным задачам.
Что сделали
Авторы исследовали структурный поиск в двух несвязанных областях. Первая — олимпиадные математические задачи: для 500 запросов система искала исходную задачу в корпусе из 117 088 документов. Формулировку запроса меняли, сохраняя способ решения, а рядом помещали ловушки с похожим текстом, но другой математической структурой.
Вторая область — траектории агентов в ALFWorld. Здесь использовали 118 запросов и 336 последовательностей действий. Правильным считался сценарий того же типа, но с другими предметами или местами назначения. Например, агент должен был перенести не тот же предмет в ту же ёмкость, а выполнить аналогичную процедуру над другими объектами.
Сначала модели эмбеддингов ранжировали весь корпус по косинусной близости — сходству между числовыми представлениями текстов. Затем несколько моделей-оценщиков повторно сортировали фиксированный список top-10, то есть десять лучших кандидатов первого этапа. Отдельный лексический переранжировщик учитывал только совпадения слов, редакционное расстояние и близость длины текстов. Он служил контрольным тестом: добавлял поверхностное сходство, но не мог рассуждать о структуре.
Что показали
На сложных математических переформулировках обе основные модели эмбеддингов ни разу не поставили исходную задачу на первое место. При этом правильный документ часто уже находился внутри top-10. По интерпретации авторов, проблема возникала не на этапе извлечения кандидатов, а при определении их порядка: выигрывала задача с похожими словами, хотя способ решения отличался.
В ALFWorld авторы обнаружили сходный поведенческий результат. Когда правильная траектория должна была отличаться и предметом, и местом назначения, модели работали хуже случайного выбора. Буквальные названия объектов оказывались сильнее сходства процедур.
Переранжирование с помощью модели-оценщика вернуло 5–63% доступного улучшения в математике и 43–76% в траекториях. Направление эффекта сохранялось между использованными оценщиками, но его величина, реакция на сложность переформулировки и относительный порядок моделей менялись. Поэтому результат одного оценщика нельзя переносить на другой домен или даже на другой стиль запроса.
Лексический контроль закрыл 26–36% доступного разрыва в траекториях, но ухудшил математический поиск. Авторы связывают различие с устройством тестов. В математике совпадение слов было специально превращено в ловушку, а в траекториях возникало естественно и частично указывало на тип процедуры. Следовательно, знак эффекта лексического контроля характеризует не только поисковую модель, но и конструкцию набора данных.
Ограничения
Работа не показывает, что поиск по эмбеддингам в целом неработоспособен. Авторы проверяли узкую ситуацию, где формулировка и структура намеренно расходятся. Математический набор использует сгенерированные переформулировки и примеры-ловушки, поэтому измеряет устойчивость к конкретному способу маскировки. Траектории относятся к одному семейству данных и ограниченному набору типов бытовых задач.
Сравнение охватывает несколько моделей эмбеддингов, моделей-оценщиков и простой лексический контроль, но не включает специально обученный структурный поисковик или переранжировщик. Поэтому работа не отвечает, можно ли устранить смещение обучением на структурных парах, а не добавлением общей LLM после поиска.
В математической части авторы также нашли признаки возможного запоминания известных соревнований моделью-оценщиком, но дизайн эксперимента не позволяет отделить память от рассуждения. Проверка влияния поиска на конечное решение проведена с одним решателем, у которого почти не оставалось пространства для улучшения: завершённые ответы и без дополнительного контекста обычно были правильными, а ошибки во многом совпадали с обрывом генерации. Из этого опыта нельзя делать общий вывод о пользе RAG для математических систем.
Что это значит
Работа не требует менять базовую архитектуру систем, где сначала получают кандидатов по эмбеддингам, а затем уточняют порядок. Она меняет критерии приёмки такой архитектуры. Обычный тест, в котором релевантный документ повторяет слова запроса, может подтвердить способность находить тему, но ничего не сказать о поиске процедур, причинных схем или способов решения.
Командам, которые строят на таком поиске, стоит разделять извлечение и ранжирование в метриках. Если правильный объект уже присутствует среди кандидатов, замена модели эмбеддингов может дать меньше пользы, чем отдельный переранжировщик. Но выбирать его по одному публичному тесту рискованно: по замерам авторов результат зависит от модели-оценщика, формулировки инструкции, домена и происхождения данных.
В собственный набор проверки полезно включать пары двух типов: одинаковая структура при разных словах и похожий текст при разной структуре. Лексический контроль здесь становится дешёвой диагностикой. Если он улучшает результат, набор, вероятно, всё ещё позволяет выигрывать за счёт слов; если ухудшает — поверхностное сходство конфликтует с целевой релевантностью.
Для планов разработки вывод локальный: переранжирование стоит закладывать как отдельный проверяемый этап, когда продукт ищет аналогичные процессы, решения или траектории, а не просто документы на одну тему. Переезд на другую модель эмбеддингов без структурного теста не подтверждает, что система стала лучше понимать задачу.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



