Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Shachar Don-Yehiya, Leshem Choshen и Omri Abend проверили, помогают ли отзывы пользователей исправлять ответы LLM; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, доступ к отзыву повышал долю исправленных ошибок вплоть до 35 процентных пунктов. Результат важен командам, которые используют пользовательские реакции для дообучения моделей или автоматически оценивают качество правок.
Что сделали
Авторы сравнили две версии правки одного ответа: модель либо получала отзыв с указанием на проблему, либо видела только предыдущий диалог. В синтетической части эксперимента в ответы намеренно вносили ошибки четырёх типов — например, меняли местами причину и следствие, удаляли существенную деталь или обращали логический оператор. Это давало заранее известный правильный вариант. Отдельно авторы извлекли применимые к другим пользователям замечания из реальных англоязычных диалогов ShareLM.
Для правок использовали Gemini-3-flash-preview и Qwen3-8B, а результат проверял Gemini-3.1-Pro-preview. С отзывом модели устраняли целевую проблему на 9–35 процентных пунктов чаще, чем без него. Однако при попарном выборе лучшего ответа модель-оценщик часто отдавала предпочтение версии без отзыва.
Авторы отдельно рассмотрели случаи, когда отзыв помог исправить ошибку, а самостоятельная правка — нет. На реальных диалогах оценщик выбирал действительно исправленный ответ лишь в 34–54% таких сравнений. По интерпретации авторов, модель может предпочитать общие стилистические улучшения и не распознавать содержательное исправление, которое сама не смогла найти без внешней подсказки.
Что это значит
Обычная попарная оценка через LLM может отсеивать полезные пользовательские сигналы: правка устраняет указанную ошибку, но получает более низкую оценку, чем гладкий ответ без исправления. Поэтому при подготовке данных для дообучения одной общей оценки качества недостаточно. Нужна отдельная проверка того, устранена ли конкретная проблема из отзыва.
Ограничения. Авторы проверили метод на 2 000 синтетических примерах и 1 000 фрагментах реальных англоязычных диалогов. Основные синтетические результаты относятся к заданиям по математике и коду: генерация ошибок для творческих текстов оказалась менее надёжной. Проверка реальных отзывов остаётся приближённой, а попарные решения оценщика не получили полноценной ручной разметки. Эксперимент охватывает ограниченный набор моделей и исправление ответов во время выполнения запроса, поэтому работа не показывает, сохранится ли эффект после дообучения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



