Журнал · Rit.work

Дешёвая модель может повысить счёт ИИ-агента

Маршрутизация моделей с учётом кеша сократила расчётные расходы на ИИ-агентов для разработки на 14–21%, но результат пока получен только в эмуляции.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Стоимость работы ИИ-агентов для разработки зависит не только от тарифа: на длинной сессии дорогая модель иногда обходится дешевле следующей по цене. В препринте Accenture и Harvard, который не прошёл рецензирование и где числа получили сами авторы, маршрутизатор сократил расходы на модели на 14–21%. Корпоративной платформе недостаточно выбирать самую дешёвую подходящую модель — нужно учитывать историю сессии и правила кеширования.

Маршрутизатор использует классификатор Jev: он определяет тип запроса и оценивает, справится ли более дешёвая модель. Решение принимается в начале сессии, при запуске отдельной короткой задачи или подагента. Уже идущий диалог остаётся на прежней модели, чтобы не переносить накопленную историю.

Каждый вызов инструмента заставляет агента снова отправлять модели контекст диалога. Повторный контекст для той же модели читается из кеша со скидкой, а при переключении его приходится записывать заново. Поэтому при 18 шагах с инструментами Fable 5.1 становилась дешевле Opus 5 после того, как контекст превышал 65 тысяч токенов: высокая цена обычного ввода компенсировалась более дешёвым чтением кеша.

Схема также избегает переноса небольших задач вместе со всей историей. Такие запросы уходят в отдельные ветки с кратким описанием проекта, а подагент получает модель при запуске. Так платформа сохраняет основной кеш и меняет модель только там, где переключение не создаёт повторную запись контекста.

Проверка охватила эмуляцию компании на 10 тысяч мест и около 10 тысяч публичных сессий разработчиков. При заложенной интенсивности использования расчётная экономия составила $3,3–5,0 млн в год. Но задачи в эмуляции были синтетическими, цены относились к одной линейке моделей, а шлюз и точки принудительного применения политики описаны, но не реализованы: перед внедрением схему нужно пересчитать на собственных сессиях, договорных тарифах и длительности пауз между запросами.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу