Журнал · Rit.work

CoLearn хранит историю ошибок ученика и выбирает следующий вопрос

Архитектура CoLearn связывает оценку ответов, постоянную модель знаний и генерацию заданий, но пока подтверждает релевантность вопросов, а не рост знаний.

Rit.work
Студия разработки
21 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

CoLearn научили запоминать знания и повторяющиеся ошибки ученика, чтобы следующий вопрос опирался на всю историю занятий. В препринте, который не прошёл рецензирование, все числа получили сами авторы: персонализированные вопросы выбирали как более релевантные в 68–69% слепых сравнений. Для команд это пример архитектуры, где LLM не просто ведёт диалог, а обновляет явное состояние пользователя между сессиями.

Память отделена от диалога и обновляется после каждого ответа

CoLearn хранит отдельную запись для каждой пары «ученик — предмет». В ней лежат оценки знаний по темам, список повторяющихся заблуждений и история изменений. Поэтому новая сессия продолжает предыдущую, а не начинает разговор с пустого контекста.

После ответа LLM выставляет не бинарную отметку «верно» или «неверно», а непрерывную оценку того, насколько ответ подтверждает знание темы. Вместе с ней модель возвращает уверенность в своей оценке. Эти значения поступают в байесовское отслеживание знаний — расчёт, который пересматривает вероятность владения темой по мере появления новых свидетельств.

Формула ограничивает влияние неуверенной оценки и не позволяет явно неправильному ответу повысить предполагаемый уровень знаний. При этом значение на шкале остаётся убеждением системы, а не прямым измерением того, что ученик действительно освоил материал.

Для коротких ответов LLM также выделяет заблуждение и подкрепляет его цитатой из текста ученика. Система различает ошибочное утверждение и пропуск важной части ответа, приводит совпадающие формулировки к общему виду и удаляет повторы. В заданиях с выбором ответа каждому неверному варианту заранее сопоставлено конкретное заблуждение, поэтому такой ответ можно разобрать без отдельного обращения к LLM.

Генератор выбирает самую слабую тему и связанные с ней ошибки, затем составляет следующее задание. Если истории ещё нет, CoLearn начинает с подготовленных вопросов. Интерфейс показывает текущую оценку знаний и объясняет, почему система выбрала конкретное задание; отдельный слепой A/B-тест сравнивает его с вопросом по случайной теме.

Проверка показывает точность выбора темы, но не учебный эффект

Релевантность оценивали 18 участников, знакомых с учебной программой по Biology и Chemistry. Они видели персонализированный и контрольный вопросы без указания их происхождения и выбирали тот, который лучше подходит ученику в текущий момент. Преимущество персонализации оказалось статистически значимым.

Работу памяти проверяли отдельно на шести синтетических учениках со скрытым уровнем знаний и заранее заданными заблуждениями. Средняя абсолютная ошибка — среднее расстояние между оценкой системы и заданным уровнем — составила 0,12 в адаптивном режиме против 0,16–0,20 у режимов со случайным выбором темы или замороженной памятью. Оценка CoLearn приближалась к скрытому состоянию лучше, когда система одновременно обновляла память и выбирала вопросы по найденным слабым местам.

Проверка охватывает восприятие релевантности и сходимость модели ученика, а не реальное обучение. Работа не показывает, что персонализация помогает надолго усвоить материал или перенести навык на новую задачу. Авторы также не проводили отдельную экспертную проверку фактической точности, соответствия программе и качества отвлекающих вариантов в сгенерированных вопросах.

Архитектуру можно брать за основу, стратегию — пока нет

Практическая часть CoLearn — не конкретная формула, а разделение системы на оценщик ответа, постоянное состояние ученика, генератор следующего действия и слой доказательств для интерфейса. Такая схема подходит продуктам, где агент должен помнить развитие пользователя месяцами: учебным платформам, тренажёрам сотрудников и системам адаптивного введения в должность.

Команде придётся хранить не только краткое резюме диалога, но и структурированные признаки с источниками: какая тема проседает, какой ответ изменил оценку и какая цитата подтверждает ошибку. Это позволяет проверять персонализацию, отменять сомнительные обновления и сравнивать стратегии через A/B-тесты.

Сам CoLearn пока адаптирует память, но не способ обучения. Правила выбора и формулировки заданий записаны в текстовой инструкции: её можно заменить без изменения кода, однако система не переписывает её автоматически по результатам занятий. Поэтому называть эту архитектуру самообучающимся тьютором рано.

Стоимость и задержка также влияют на продуктовый план. На односерверном развёртывании вопрос с выбором ответа занимал около 7,6 секунды против примерно 32 секунд для короткого ответа; стоимость раунда составляла около 0,005 и 0,015 доллара соответственно. Разницу создают проверка свободного текста и генерация обратной связи, тогда как выбранный вариант система оценивает детерминированно.

Прототип собран как контейнерное веб-приложение с React, FastAPI, MongoDB и переключаемым поставщиком LLM. Это делает его полезным архитектурным ориентиром, но решение о запуске стоит связывать с собственной проверкой качества заданий и учебного результата, особенно для слабых учеников: именно их ответы оценщик в экспериментах разбирал менее надёжно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу