Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Математического LLM-тьютора научили не выдавать очередную подсказку автоматически после каждой реплики ученика. В работе SUNY Buffalo система DICE эффективнее расходовала лимит диалога, чем несколько сократических тьюторов; это не прошедший рецензирование препринт, и все числа получили сами авторы. Для разработчиков агентов результат предлагает отдельный уровень управления между состоянием диалога и генератором ответа.
Сначала выбрать действие, потом сформулировать ответ
Обычный LLM-тьютор решает задачу как продолжение диалога: получает реплику ученика и генерирует следующую учительскую реплику. Такая схема хорошо отвечает на вопрос «что сказать», но не проверяет, нужно ли вообще вмешиваться.
Из-за этого содержательно правильный ответ может оказаться лишним. В одном из приведённых диалогов ученик получил верный итог 270, но SocraticLM продолжил просить пересчитать стоимость и налог. Тьютор подтвердил решение только после того, как ученик повторил уже выполненные вычисления.
DICE сначала выбирает педагогическое действие: принять ответ, исправить арифметику, дать понятийную подсказку, ответить на вопрос ученика, вернуть его к задаче или попросить обоснование. Генератор получает выбранное действие и только после этого формулирует реплику.
Так архитектура разделяет три решения, которые обычно скрыты в одной генерации: вмешиваться ли, какое действие выбрать и какими словами его выразить. Отказ от подсказки здесь не означает, что система теряет управление сессией: она может принять верное решение и перевести ученика дальше.
Intervention Value сравнивает подсказку с невмешательством
Для обучения политики действий авторы ввели Intervention Value — ценность вмешательства. Метрика оценивает продолжение с выбранным педагогическим действием и сравнивает его с вариантом, где тьютор не вмешивается. Если ученик продвигается не хуже сам, у подсказки нет положительной добавочной ценности.
Такой сигнал отличается от обычной разметки «правильного ответа учителя». Разметчик видит эталонное решение и почти всегда может придумать уместную подсказку, но из этого не следует, что она улучшит ход сессии. Аудит показал, что почти половина предписанных вмешательств не давала добавочной пользы или ухудшала результат.
DICE использует эту оценку как вес при обучении политики. Регуляризация удерживает новую политику рядом с исходным поведением, а при запуске система может учитывать стоимость вмешательства либо отвечать только тогда, когда уверенность превышает порог. Проверка компонентов показала, что основной вклад в результат внесла именно отдельная политика действий; проверка принятого ответа и защита финального ответа дополнили её.
Эксперименты провели на DICE-Bench, построенном из математических задач SocraTeach на основе GSM8K и MAWPS. Набор включает 10 273 группы из лёгкого, исходного и усложнённого вариантов одной задачи, а также 20 477 состояний с размеченным следующим действием. Полные сессии проходили с моделями, которые имитировали ученика, и общим лимитом в 20 ходов, поэтому результаты описывают математическое обучение в симуляции, а не занятия с людьми.
В этом режиме DICE-Cost решил всю последовательность в 56,4% сессий — на 18,8 процентного пункта чаще, чем SocraticLM. Ему требовалось примерно на три хода меньше, а доля избыточных вмешательств составила 2,8% против 42% у SocraticLM. Под избыточным вмешательством авторы понимают ситуацию, когда тьютор продолжает направлять ученика после достаточного правильного ответа.
Для продуктовой команды меняется контур управления агентом
Работа не требует заменять модель, которая пишет реплики. Главное архитектурное изменение — вынести перед ней классификатор педагогических действий и разрешить ему выбрать принятие ответа без новой подсказки. Такой слой проще проверять отдельно: команда может измерять ошибки принятия, лишние вмешательства и стоимость каждого действия, не смешивая их с качеством текста.
Одного порога уверенности для промышленного тьютора недостаточно. В DICE безопасное принятие ответа поддерживают отдельный проверяющий модуль и защита финального ответа. Разбор компонентов показывает, что без проверяющего модуля система чаще принимала неверные решения ученика, даже если в среднем вмешивалась реже.
Intervention Value полезен и за пределами обучения математике, если агент многократно решает, стоит ли прерывать процесс советом или исправлением. Но перенос потребует собственного определения прогресса и способа сравнить действие с невмешательством. В DICE это возможно благодаря задачам с проверяемым ответом, вариантам одной сложности и симулированному продолжению диалога.
Поэтому работа меняет скорее проектирование следующей версии, чем обосновывает немедленную замену работающего тьютора. Команде имеет смысл отделить решение о вмешательстве от генерации, добавить журнал выбранных действий и собирать данные о том, улучшила ли подсказка дальнейший результат. Числа DICE пока подтверждают эту схему только в ограниченной математической симуляции.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



