Журнал · Rit.work

TTSE разделяет знания об окружении и навыки LLM-агента

TTSE хранит факты о среде отдельно от процедур и обновляет оба типа знаний по результатам работы агента — разбор архитектуры, замеров и границ метода.

Rit.work
Студия разработки
22 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Память LLM-агента разделили на факты об окружении и процедуры действий, чтобы он мог независимо исправлять знания о мире и собственные навыки. В работе Poisson Lab и Huawei связка TTSE с Bayesian-Agent подняла итог SOPBench на 15,4 процентного пункта, хотя препринт не рецензирован, а все числа получили сами авторы. Для долгоживущих агентов это предлагает альтернативу единой библиотеке опыта, где факты, предположения и инструкции со временем начинают конфликтовать.

Факты и процедуры живут по разным правилам

TTSE делит опыт агента на два хранилища. FACT содержит проверяемые свойства среды: например, закрытый контейнер нужно открыть, прежде чем искать внутри предмет. TIP хранит условные процедуры: если задача требует несколько одинаковых предметов, после первого нужно продолжить поиск.

Кандидатов распределяет сама LLM через инструкции в запросе, без отдельного классификатора и размеченных примеров. Она проверяет, относится ли правило к среде или к действиям агента, а также приводит ли его нарушение к прямому провалу или лишь снижает эффективность. Неоднозначное правило попадает в TIP, чтобы предположение не закрепилось как универсальный факт.

Хранилища обновляются после очередной группы задач. Система связывает неудачу с использованными правилами, выводит ошибочные правила из активной памяти, ищет противоречия и затем извлекает новые знания из успешных и провальных траекторий. Удалённые записи сохраняются для аудита и помогают обнаруживать скрытые условия.

Если два правила дают противоположные советы, TTSE не обязана выбирать одно. Она может объединить их в условную процедуру: один способ действует при одном состоянии среды, другой — при другом. Так конфликт превращается из помехи в указание на пропущенное различие.

Теоретическая часть разделяет ошибку агента на две составляющие. Первая возникает, когда FACT не отражает важное состояние среды; вторая — когда TIP выбирает неверное действие даже при достаточных фактах. Условная политика строго выигрывает у общей только тогда, когда одинаково выглядящие ситуации могут требовать разных действий. Это не гарантия роста любой метрики, а формальное описание условий, при которых разделение памяти вообще должно помогать.

Разделение памяти проверили на разных типах задач

TTSE проверяли на GDPevo, ALFWorld, ScienceWorld, SOPBench и PinchBench. Наборы охватывают аудит корпоративных API, взаимодействие с предметами, научные задачи, выполнение регламентов и работу с инструментами. В экспериментах использовали GLM-5, DeepSeek-V3.2 и DeepSeek v4-flash, поэтому результат не привязан к одной базовой модели.

В PinchBench TTSE добавили в агент OpenClaw без изменения его основной схемы. Для новой задачи система находила релевантные FACT и TIP по смысловой близости и добавляла их в контекст. Средняя оценка выросла на 3,83 процентного пункта, а разброс между повторами сократился с 3,33 до 1,61 пункта. В одном повторе число полностью выполненных задач увеличилось с 65 до 70.

На ALFWorld и ScienceWorld двухконтурная память улучшила основные результаты, а на SOPBench совместилась с вероятностным обновлением правил в Bayesian-Agent. Эффект при этом зависел от предметной области: в одном разделе SOPBench двухконтурный вариант уступил одноконтурному. Разрыв между полной версией TTSE и вариантом только с TIP отдельно не проверяли на статистическую значимость.

Эксперименты сравнивают подходы в пределах заданных бенчмарков, бюджетов траекторий и повторных запусков. Они показывают переносимость архитектурного решения, но не доказывают, что два хранилища выразительнее любой возможной единой памяти.

Когда двухконтурная память меняет архитектурный план

TTSE стоит учитывать, если агент долго работает в среде, где меняются состояния объектов, поведение API или правила выполнения операций. В такой системе библиотеку навыков полезно дополнить отдельным хранилищем фактов, собственными признаками надёжности и независимым жизненным циклом записей. Тогда ошибку среды можно исправить, не удаляя полезную процедуру, и наоборот.

Практическое изменение невелико: вместо одного набора заметок появляются условные процедуры и проверяемые утверждения о среде. В OpenClaw они даже записывались раздельно в ENVIRONMENT.md и TIPS.md, а в контекст попадали через поиск релевантных записей. Для внедрения не требуется менять веса базовой модели.

Если задачи одноразовые, среда стабильна, а один и тот же контекст всегда требует одинакового действия, теория TTSE не обещает преимущества. Дополнительный контур принесёт обновление правил, поиск противоречий и новые вызовы LLM, но может не снизить ошибку.

Есть и эксплуатационная граница. Хранилище начинает работу пустым, поэтому первые задачи зависят от исходных возможностей модели. Новые правила также извлекает LLM, которая может закрепить случайную или слишком узкую закономерность; текущая схема исправляет такие записи после неудач, но не проверяет каждое правило на отдельном контрольном наборе до его активации.

Главный вывод для архитектуры — хранить наблюдение о мире не как приложение к навыку, а как самостоятельный объект с доказательствами, отзывом и историей изменений. Это особенно уместно там, где агент должен не только запоминать удачные действия, но и пересматривать представление о среде.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу