Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Hyunseo Oh, Chong-Kwon Kim и Yoonhyuk Choi исследовали селективное подключение внешних материалов к генерации (RAG) в одношаговых ответах о психическом здоровье; результаты изложены в препринте, который не проходил рецензирования. В состязательном тесте безусловный RAG поднял среднюю частоту нежелательного поведения с 2,5% до 9,17%, тогда как селективный вариант сохранил уровень генерации без поиска. Работа важна командам, которые проектируют помощников для медицины, поддержки клиентов и других процессов, где дополнительный контекст может не только уточнить ответ, но и повысить риск.
Что сделали
Авторы поставили задачу не улучшить поиск как таковой, а решить, когда его вообще следует включать. Они сравнили три режима одного и того же генератора: ответ только на основе параметров модели, поиск для каждого запроса и селективный поиск. Благодаря общему генератору различия между режимами можно связывать с политикой подключения материалов, а не со сменой модели.
Основой стала Gemma-4-E4B-it, дообученная методом QLoRA на MentalChat16K. QLoRA позволяет адаптировать модель через небольшой набор дополнительных параметров, не переобучая её целиком. Для поиска авторы собрали контролируемый корпус из 40 документов: материалы о способах совладания со стрессом, психообразовательные объяснения и рекомендации для кризисных ситуаций. Фрагменты отбирались алгоритмом BM25, который ранжирует тексты по совпадению терминов с запросом.
Селективный режим сначала создаёт черновик без внешних материалов. Затем тот же генератор оценивает потребность в психообразовательном объяснении, практических способах совладания и большей конкретике. Отдельное правило ищет признаки самоповреждения, суицида, насилия, кризиса и небезопасных запросов о лекарствах. При таком сигнале поиск включается обязательно и направляется в раздел материалов о безопасности; в остальных случаях решение зависит от оценок черновика.
Проверка проводилась на CounselBench-Eval для общей оценки ответов и CounselBench-Adv для состязательных запросов, провоцирующих медицинские, терапевтические и другие нежелательные рекомендации. Автоматическую оценку дополнили небольшим экспертным аудитом примеров, чувствительных к поиску и безопасности.
Что показали
По автоматической оценке общей полезности безусловное добавление материалов не улучшило настроенный генератор. Режим без поиска получил 4,15 балла, безусловный RAG — 4,12, а селективный — 4,17. Авторы интерпретируют это не как крупный прирост качества, а как отсутствие ухудшения при контролируемом использовании источников.
Безусловный поиск делал ответы конкретнее, но одновременно чаще приводил к чрезмерно директивным терапевтическим формулировкам и предположениям о состоянии пользователя. Селективный режим сохранил частоту нежелательного поведения на уровне варианта без поиска. В экспертном аудите его чаще выбирали как лучший ответ, однако замечания к профессиональным границам не исчезли полностью.
Главный результат работы относится не к точности поиска, а к архитектуре управления им. В чувствительной предметной области внешний контекст оказался вмешательством со своими побочными эффектами: подходящий фрагмент может добавить конкретику, но также сдвинуть ответ в сторону диагностики, медицинских указаний или излишней уверенности.
Ограничения
Авторы проверили одну семью генераторов, одношаговый сценарий и два набора заданий из одной системы бенчмарков. Работа поэтому не показывает, сохранится ли результат на других моделях, независимых наборах данных, в продолжительном диалоге или при изменении состояния пользователя между сообщениями.
Корпус намеренно мал и контролируем, что упрощает анализ, но ограничивает покрытие тем. В сравнении нет других поисковых алгоритмов, обучаемых маршрутизаторов и независимо откалиброванных моделей для принятия решения: черновик создаёт и оценивает один генератор. Нельзя отделить свойства предложенного правила от особенностей этой модели и корпуса.
Основные выводы опираются на автоматических моделей-оценщиков, а экспертная проверка охватывает только небольшую целевую часть примеров и не является клинической валидацией. Работа также не измеряет задержку, вычислительную стоимость и эксплуатационную сложность дополнительной генерации черновика. По ней нельзя заключить, что селективный режим дешевле или быстрее обычного RAG.
Что это значит
Для команд с безусловным RAG работа меняет план архитектуры, но не обосновывает смену модели или технологического стека. Подключение базы знаний стоит рассматривать как отдельное управляемое решение, а не как постоянную часть каждого ответа. Особенно это относится к системам, где найденный текст способен превратить нейтральную рекомендацию в медицинское, юридическое или финансовое указание.
Практический план прототипа следует дополнить четырьмя элементами:
- сохранить полноценный режим ответа без внешнего контекста;
- ввести шлюз, оценивающий нехватку объяснения, практических действий и конкретики;
- отделить жёсткие признаки риска от мягкой оценки полезности поиска;
- тестировать без поиска, постоянный RAG и селективный RAG как самостоятельные варианты на обычных и провокационных запросах.
Для продукта, который ещё не использует RAG, работа не доказывает необходимость его добавлять. Она показывает более узкий ориентир: если внешние материалы нужны лишь части запросов, политику их подключения следует проектировать и оценивать наравне с самим генератором. Решение о запуске в сфере психического здоровья всё равно потребует более широкой экспертной и клинической проверки.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



