Журнал · Rit.work

HARPO разделяет награду за достоверность и качество текста

HARPO сначала проверяет ответ на галлюцинации и только затем награждает модель за качество текста, снижая конфликт между достоверностью и выразительностью.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили сокращать неподтверждённые утверждения, не превращая ответы в короткие и осторожные отписки. В препринте с участием Huawei, который не проходил рецензирование и приводит замеры самих авторов, доля ответов с галлюцинациями на MultiHopRAG снизилась с 3,29% до 1,02%. Работа предлагает не искать постоянный баланс между достоверностью и стилем, а включать награду за качество текста только после проверки фактов.

Оценщик ищет ошибку и указывает её границы

В основе HARPO лежит HA-GRM — генеративная модель-оценщик. Она решает три задачи: определяет, содержит ли весь ответ неподтверждённые сведения, отмечает конкретные ошибочные фрагменты и сравнивает два варианта текста по полезности, уместности, краткости, полноте и выразительности.

Оценщик обучали на Qwen3-4B с помощью GRPO. Для проверки достоверности он получал правильную метку ответа и размеченные границы галлюцинаций. За верный вывод начислялась награда, а точное выделение ошибочного фрагмента увеличивало её. Для оценки текста модель выбирала лучший вариант из пары и получала награду за совпадение с человеческим предпочтением.

Разметка фрагментов оказалась полезнее одной бинарной метки. На RAGTruth итоговая F1 выросла на 11,71 процентного пункта относительно обучения с учителем. F1 объединяет точность и полноту: высокая оценка требует не только находить большинство ошибок, но и не объявлять ошибочными корректные ответы.

Совместное обучение всё же оставило конфликт между задачами. Когда к поиску галлюцинаций добавили предпочтения по качеству текста, оценщик лучше выбирал удачный ответ, но немного хуже распознавал галлюцинации. HARPO не устраняет этот конфликт внутри оценщика, а меняет способ, которым его сигналы влияют на основную модель.

Награда за стиль открывается после проверки фактов

Обычная схема складывает награду за достоверность и награду за качество с постоянными весами. Модель может компенсировать неподтверждённое утверждение подробным и убедительным изложением. Тогда формально высокий общий балл не означает, что ответ опирается на источник.

HARPO ставит между двумя наградами условный шлюз. HA-GRM сначала ищет неподтверждённые фрагменты. Если находит их, модель получает штраф, который зависит от доли ошибочного текста, а награда за стиль не учитывается. Если оценщик считает ответ достоверным, к награде добавляется оценка качества письма.

Это не гарантирует истинность: пропущенная оценщиком галлюцинация всё равно откроет награду за стиль. Но схема задаёт понятный приоритет — выразительность нельзя использовать как компенсацию за нарушение проверяемого ограничения.

Второй элемент HARPO — расписание обучающих данных. В начале преобладают задания на творческое письмо, затем обучение плавно смещается к пересказу источников и ответам на вопросы по контексту. Небольшая доля творческих заданий сохраняется до конца, чтобы модель не забыла навыки письма после перехода к строгой проверке.

На Arena-Hard-v2.0 оценка творческого письма выросла с 16,95% до 27,54%. Однако сравнение с линейным смешиванием наград не дало победы по всем показателям: HARPO лучше справился с достоверностью пересказа и общими заданиями, но немного уступил в многошаговых вопросах и творческом письме. Условный шлюз меняет компромисс, а не отменяет его.

Командам стоит заимствовать приоритеты, а не весь конвейер

Работа меняет планы команд, которые дообучают модели сразу под проверяемые ограничения и субъективное качество. Вместо долгого подбора коэффициентов для общей награды можно формализовать порядок: сначала обязательное условие, затем оптимизация предпочтений. Такой подход подходит не только для галлюцинаций, но и для формата ответа, соблюдения политики или наличия обязательных данных — если проверку можно превратить в достаточно надёжный сигнал.

HARPO требует отдельного оценщика, размеченных границ ошибочных фрагментов и генерации нескольких ответов во время обучения. Авторы отдельно отмечают, что такая разметка дороже бинарных меток, а генеративный оценщик увеличивает вычислительные затраты по сравнению с классификатором.

Проверка охватила Qwen2.5 и Qwen3 размером от 1,7 до 8 млрд параметров, а задания относились к пересказу, ответам по контексту и творческому письму. Все эксперименты запускали по одному разу. Доля галлюцинаций также измерялась тем же HA-GRM, который выдавал награду при обучении, поэтому перед внедрением понадобится независимый оценщик на данных продукта.

Практический вывод — не переносить HARPO целиком, а сначала проверить условную схему наград на одном жёстком ограничении. Если независимая проверка подтвердит, что модель перестала обменивать корректность на убедительный стиль, тогда оправданы собственный оценщик, разметка фрагментов и расписание данных.

Источники

Иллюстрация: рисунок из статьи «HARPO: Hallucination-Aware Reinforcement Learning for Faithful and Creative Language Generation», Tiezheng Yu, Yuxin Jiang, Jinpeng Li и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу