Журнал · Rit.work

Agentic-TTT выбирает, когда модели стоит доучиваться на запросах

Agentic-TTT управляет дообучением модели после запуска: выбирает подходящий метод, повторно использует навыки и учитывает затраты на вычисления.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Языковую модель научили самой решать, когда менять собственные параметры под входящую задачу, какой способ выбрать и когда ответить без дополнительного обучения. В Agentic-TTT итоговая полезность Qwen2.5-7B выросла с 0,256 до 0,510; это нерецензированный препринт, и числа получили сами авторы. Такой диспетчер позволяет не привязывать продукт к одному способу адаптации модели после запуска.

Дообучение во время работы (test-time training) обновляет параметры модели на данных, которые приходят уже после развёртывания. Agentic-TTT превращает пять методов такого дообучения в доступные модели инструменты. Для каждого запроса она может сразу сформировать ответ, добавить данные в набор для будущего обучения, создать адаптер LoRA или подключить навык, созданный ранее.

Базовая модель при этом остаётся неизменной, а каждый новый навык хранится отдельно вместе с текстовым описанием. Политика выбора учится в два этапа: сначала осваивает допустимые последовательности действий на примерах, затем получает награду за прирост качества и штраф за лишние вычисления. Поэтому она учится не только выбирать метод, но и отказываться от адаптации, если та не окупается.

Фиксированные методы давали неравномерный результат и на отдельных типах задач ухудшали ответы. Agentic-TTT улучшила среднюю полезность во всех восьми проверенных областях. При умеренном штрафе за вычисления политика сократила их примерно на 30% и при этом получила более высокую полезность, чем вариант без штрафа: без явной цены модель слишком часто запускала дообучение.

Проверка охватывала 176 отложенных запросов из 11 семейств тестов: математику, код, логику, медицину, работу с текстами и другие задачи. Набор намеренно составили так, чтобы большинство запросов подходило для дообучения, поэтому результат описывает благоприятный для метода сценарий. Подход также проверили на Qwen, Llama и GLM: общий результат вырос у всех моделей, хотя в отдельных областях адаптация всё ещё снижала качество.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу