Журнал · Rit.work

Долгая работа LLM-агента держится на файлах, тактах и ревью

Salesforce AI Research показала архитектуру, которая переносит состояние LLM-агента через перезапуски, управляет автономной работой по тактам и передаёт сложные решения более способным моделям.

Rit.work
Студия разработки
18 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM-агент непрерывно вёл исследовательскую задачу через перезапуски, смены сессий и отсутствие человека. В препринте Salesforce AI Research, который не прошёл рецензирование и приводит замеры самих авторов, он за десять дней воспроизвёл опубликованный результат по обучению с подкреплением при участии человека раз в сутки. Длительность такой работы задаёт не окно контекста модели, а управляющая оболочка (harness), которая хранит состояние, запускает следующий шаг и проверяет результат.

Память разделили по масштабу времени

Долгая задача переживает контекст модели, процесс агента, периоды человеческого внимания и сбои инфраструктуры. Увеличенное окно контекста лишь откладывает переход через первую границу: после сжатия истории или перезапуска процесс всё равно должен восстановить цель, ограничения и текущий план.

Архитектура делит работу на семь уровней — от вызова инструмента, который занимает секунды, до цели, рассчитанной на неделю. Каждый уровень хранит ограниченный файл с текущим состоянием: нижний записывает подробности выполнения, верхний получает сжатую оценку и решает, что делать дальше.

Указания идут вниз, а результаты, предупреждения и запросы на решение — вверх. Агент не перечитывает необработанные журналы целиком: рабочая сессия получает контрольную точку, постоянные решения человека, открытые вопросы и карточки активных экспериментов. Если журнал обновился позже контрольной точки, при восстановлении приоритет получает журнал.

Файл здесь служит не приложением к диалогу, а частью протокола. Для него заранее задают автора, читателя, период обновления и проверку. Поэтому состояние не зависит от памяти конкретной сессии, а новая сессия продолжает работу с того же места.

Так агент накапливает рабочие знания без изменения весов модели. Ответ руководителя становится постоянным правилом, замечание проверяющей модели попадает в следующие карточки экспериментов, а найденный способ запуска переносится в задания для менее способных исполнителей.

Такт задаёт автономию, а ревью управляет эскалацией

Единицей самостоятельной работы служит такт. Часы запускают свежую управляющую сессию, она читает состояние, применяет зарегистрированные правила, выбирает действие и перед завершением записывает новую контрольную точку. Интервал до следующего запуска тоже хранится в состоянии, поэтому агент может ускорять или замедлять работу без ручного перезапуска.

Задачу сначала получает самый низкий подходящий уровень моделей. Следующий уровень проверяет результат и при ошибке возвращает его с замечаниями. Если исправление не помогает, работа поднимается к более способной модели, а решения из заранее определённого класса доходят до человека.

Такой каскад связывает расход вычислений с ценой ошибки. Более способная модель читает уже сжатое состояние и разбирает спорные случаи, а не сопровождает каждый вызов инструмента. Когда она находит рабочий рецепт, следующие исполнители получают его в задании и снова работают на нижнем уровне.

Проверки встраиваются до запуска, а не после провала кампании. Карточка эксперимента фиксирует гипотезу, критерий успеха, условие досрочной остановки, предел ресурсов и источник каждого показателя. Отдельная проверяющая сессия без истории разговора ищет смешанные факторы, слабые показатели и способы формально пройти тест, не решив исходную задачу.

Сбои обрабатывает уровень выше отказавшего компонента. Зависшего исполнителя запускают заново с тем же заданием, управляющую сессию восстанавливают из контрольной точки, а сторожевой процесс прекращает повторные перезапуски, если восстановление не срабатывает.

Кампания показала работоспособность схемы, но не её универсальность

Агент воспроизводил результат об асинхронном обучении с подкреплением: устаревшие данные разрушали обучение без поправки, а вариант с коррекцией сохранял стабильность на двух масштабах модели. Кампания прошла более 200 тактов и потребовала около двух десятков эскалаций к человеку.

Один эпизод показывает, зачем между исполнителем и задачей нужен управляющий уровень. Работа с крупной моделью занимала 958 секунд на шаг и не давала диагноза. Управляющая сессия сформулировала проверяемые причины, направляла испытания и сократила время шага до 180 секунд без передачи задачи верхнему модельному уровню.

Ревью также меняло ход работы до расхода основных ресурсов. Проверяющая модель нашла способ удовлетворить автоматический критерий без решения задачи и заметила, что правило остановки сравнивает результат с временным провалом контрольного варианта. Среду и правило переделали до фиксации итогов.

Для команд эта работа меняет порядок проектирования. Сначала стоит вынести состояние из контекста, определить такт, форматы заданий, проверки и правила эскалации. Только после этого имеет смысл увеличивать автономность или добавлять обучение на накопленной истории: журнал тактов уже образует набор примеров, а контрольные точки дают безопасные места для обучаемых решений.

Проверка охватила одну исследовательскую кампанию с фиксированным бюджетом и ежедневным участием человека. Это демонстрация реализуемой архитектуры, а не сравнение платформ или доказательство, что схема одинаково работает в эксплуатации, разработке и корпоративных согласованиях. Она позволяет проверить собственный прототип по конкретному критерию: продолжает ли агент задачу после потери любой сессии, не восстанавливая план вручную.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу