Журнал · Rit.work

Обычный контекст переворачивает решения Jev

Короткие уместные дополнения заставили Jev и другие модели уверенно выбирать заранее заданный неверный вариант при неизменном вопросе.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Короткая уместная фраза может заставить модель сменить правильное решение на заранее выбранное неправильное, хотя сам вопрос не изменился. В препринте Zixiang Xu из University of Southern California, который не прошёл рецензирование и где все числа получил сам автор, Jev сменил решение в 61,4% проверок. Значит, вероятности вариантов нельзя без дополнительного контроля превращать в выбор инструмента, маршрут запроса или другое действие.

Для каждого задания модель сначала должна была дать правильный ответ. Затем для неё фиксировали наиболее вероятный неверный вариант и добавляли к исходному тексту короткие фоновые или процедурные детали. Вопрос, варианты ответа и правильный ответ оставались прежними; отдельная проверка отсеивала неуместные дополнения и прямые подсказки.

Поиск использовал вероятности вариантов как сигнал: он сохранял формулировки, которые приближали модель к неверному решению, и развивал их дальше. На одно задание приходилось до 64 проверок прошедших фильтр вариантов. Успешное дополнение содержало в среднем по медиане 31 слово, а в 229 случаях Jev присвоил заданному неверному варианту вероятность не ниже 0,7.

Проверка охватила семь наборов задач: вопросы на знания, социальные и сюжетные рассуждения, право, выбор нескольких ответов и маршрутизацию инструментов. Помимо Jev автор испытал OpenSourceJev, Von и обычный оценщик на Qwen; у них доля направленных ошибок составила от 64,9% до 73,2%. Работа измеряет уязвимость при целенаправленном подборе контекста, а не частоту таких ошибок в обычном рабочем потоке.

Структурированный ответ модели не делает решение устойчивым сам по себе. Порог уверенности тоже не защищает, если неверный вариант получает высокую вероятность. В архитектуре, где результат модели сразу запускает действие, контекст следует считать частью недоверенного входа, а необратимые и дорогие операции отделять дополнительной проверкой.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу