Журнал · Rit.work

EAGER учит LLM извлекать события без вырождения награды

EAGER сочетает проверяемые награды и разные схемы-отвлекающие примеры, чтобы точнее извлекать события и сохранять полезный сигнал при обучении LLM.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель научили точнее превращать обычный текст в структурированный список событий, их участников и ролей. EAGER прибавил 5,15 пункта F1 к лучшему предыдущему методу в работе DFKI и Carl von Ossietzky Universität Oldenburg, которая не прошла рецензирование и опирается на числа, полученные самими авторами. Для команд результат предлагает два практических приёма: разделять награду по типам ошибок и менять отвлекающие схемы между ответами одной обучающей группы.

Как проверяемые награды разделяют ошибки извлечения

Извлечение событий объединяет несколько зависимых задач. Модель должна найти фрагмент, который обозначает событие, выбрать его тип, выделить участников и назначить им роли из заданной схемы. Ошибка на первом шаге меняет всё последующее представление.

EAGER формулирует ответ как Python-код. Каждый тип события задан классом, допустимые роли — его полями, а найденное событие — экземпляром этого класса. К схеме добавляют автоматически составленные правила разметки и несколько посторонних типов событий, среди которых модель должна выбрать подходящий.

Одна итоговая оценка плохо объясняет модели, где именно она ошиблась. Поэтому EAGER раскладывает награду на шесть проверяемых компонентов:

  • Корректность структуры — можно ли разобрать ответ в ожидаемом формате.
  • Точность извлечения — насколько верно найдены события, типы, аргументы и роли.
  • Опора на исходный текст — встречаются ли найденные фрагменты в источнике дословно.
  • Штраф за лишнее — не создала ли модель больше событий и аргументов, чем требуется.
  • Полнота — покрывает ли ответ размеченные события и их участников.
  • Точность границ — насколько близки начало и конец найденного фрагмента к эталону.

Компоненты сначала нормализуют по отдельности внутри группы ответов, а затем складывают. Иначе показатель с большим разбросом подавляет остальные: модель может научиться соблюдать синтаксис, но продолжить выдумывать аргументы или обрезать их границы.

Почему разные отвлекающие схемы сохраняют обучающий сигнал

EAGER обучают через DAPO — вариант обучения с подкреплением без отдельной модели, которая предсказывает ценность ответа. Для одного примера модель создаёт группу вариантов, после чего каждый получает относительную оценку: насколько он лучше или хуже остальных.

Если все варианты построены по одному запросу с одинаковыми посторонними схемами, они часто получают одинаковые награды. Их относительные оценки становятся нулевыми, градиент почти исчезает, и обучение останавливается. Авторы называют это вырождением преимущества.

Schema-Contrastive Advantage Estimation меняет не исходный текст и не правильную схему, а набор неправильных схем для каждого ответа. Одному варианту приходится отличать медицинское событие от похожего медицинского типа, другому — от менее похожего. Разная сложность создаёт разброс наград, необходимый для обновления модели.

Это важное отличие от искусственного повышения случайности генерации. Метод вносит разнообразие в содержательную часть задачи, которую можно контролировать и воспроизводить. Такой подход применим там, где классы заданы схемой и для каждого правильного класса можно подобрать правдоподобные отвлекающие варианты.

Меняет ли EAGER планы команд со структурированным извлечением

Средний F1 EAGER составил 30,79 против 25,64 у ADELIE, лучшего предыдущего метода в сравнении. F1 сводит точность и полноту в один показатель. Без смены отвлекающих схем результат EAGER падал до 22,54, поэтому основной вклад нельзя объяснить только более подробной наградой.

Улучшение сосредоточено в сложной части задачи: показатели аргументов выросли в среднем на 7,4 пункта, а показатели фрагментов, обозначающих события, — на 2,1 пункта. Отдельные награды уменьшали лишние аргументы, неверные роли и выдуманные фрагменты, но одновременно повышали риск пропустить нужные. Полная комбинация лучше уравновесила эту зависимость между точностью и полнотой.

Для нового конвейера извлечения работа меняет порядок экспериментов. Вместо одной бинарной награды за совпадение всего ответа стоит сначала реализовать независимые автоматические проверки: формат, наличие фрагмента в источнике, число объектов, покрытие и границы. Затем нужно проверить, различаются ли награды внутри обучающих групп; если ответы однородны, дополнительные критерии сами по себе не помогут.

Проверка охватывает англоязычное извлечение по заранее заданным схемам на WikiEvents, PHEE, CASIE, GENIA11, GENIA13, MLEE и M2E2. EAGER сравнивали с запросами без дополнительного обучения, обучением на размеченных ответах и предыдущими методами обучения с подкреплением. Вывод пока относится к закрытому набору типов событий; качество также зависит от автоматически составленных правил разметки.

Командам с проверяемым структурированным результатом полезен не столько готовый рецепт EAGER, сколько диагностический принцип: подробная награда работает лишь тогда, когда варианты внутри группы получают различимые оценки. Для открытого извлечения без фиксированной схемы этот механизм нельзя перенести напрямую, потому что там сложнее автоматически построить и проверить отвлекающие классы.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу