Журнал · Rit.work

SoL-Pi сократил расход токенов coding-агентов почти вдвое

SoL-Pi автоматически нашёл четыре изменения в обвязке coding-агента, которые снижают расход токенов и стоимость API без обучения модели.

Rit.work
Студия разработки
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Обвязку агента для программирования (agent harness) научили автоматически улучшать так, чтобы модель реже передавала одни и те же данные инструментам. В препринте, который не проходил рецензирование и содержит замеры самих авторов, Haozhe Liu и коллеги показали: SoL-Pi сократил объём токенов на 44,7–49,0% при сопоставимом результате. Расходы на API снизились примерно на треть, поэтому обвязку можно рассматривать как отдельный способ экономии наряду с выбором модели и инфраструктуры.

Система изучала журналы работы базового агента Pi, предлагала изменения, запускала их в подготовленных средах и отбрасывала варианты, которые ухудшали качество. Поиск охватил 152 направления и 535 исполняемых сред с задачами из GitHub и синтетическими проверками. Итоговую оценку отделили от поиска: её результаты не использовали для последующей доработки.

Отбор прошли четыре механизма. Первый объединяет изменение файла и следующую команду проверки в один вызов. Второй сжимает контекст, только когда ожидаемая экономия перекрывает цену его перезаписи. Третий хранит крупные ответы инструментов локально и затем передаёт модели короткую выдержку со ссылкой на оригинал. Четвёртый поручает дешёвой модели сжимать журналы сборки и тестов, проверяет сохранённые цитаты и при ошибке возвращает исходный текст.

Полный набор проверили на 51 публичной задаче EdgeBench с GPT-5.6 Sol и Opus 5. На GPT-5.6 Sol средний результат снизился с 44,8 до 42,0 балла, зато стоимость токенов упала на 33,2%. Отдельная конфигурация, настроенная на качество, подняла результат до 47,2 балла и одновременно сократила поток токенов на 6,1%.

SoL-Pi искали по траекториям одной модели, а на второй перенесли без изменений. Поэтому работа показывает переносимость между двумя проверенными моделями и задачами программирования, но пока не устанавливает общий закон для других агентов. Практический вывод уже уже: прежде чем переводить длительные агентные процессы на более дешёвую LLM, стоит проверить повторные вызовы, разрастание контекста и пересылку журналов в самой обвязке.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу