Журнал · Rit.work

GAL меняет тесты по мере улучшения алгоритма

GAL чередует поиск слабых мест и доработку алгоритма, поэтому автоматизированная разработка больше не зависит только от фиксированного набора тестов.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему автоматического поиска алгоритмов научили самой придумывать проверки, которые вскрывают слабые места текущего решения. В работе GAL поднял результат Dual Chunk Attention на созданном им наборе с 0,20 до 0,90; это нерецензированный препринт, и все числа получили сами авторы. Для автоматизированной разработки это меняет цель поиска: агент теперь улучшает не только решение, но и тест, по которому его выбирают.

GAL чередует двух агентов. Агент-проверяющий ищет входные данные, на которых приближённый алгоритм уступает исходной системе, а агент-разработчик меняет алгоритм под расширенный набор тестов. Каждый найденный сбой остаётся в наборе, поэтому следующая версия должна исправить новую ошибку и не вернуть прежние.

Примеры создают программно, чтобы заранее знать правильный ответ. Затем их проверяют на системе без приближений: так агент отбрасывает задачи, которые не решает даже исходная модель. Для длинного контекста он меняет расположение и структуру значимых фрагментов, а не просто перебирает готовые запросы.

Один найденный сценарий содержал две почти одинаковые ведомости: актуальную помещали в середину контекста, устаревшую — в конец и явно помечали как устаревшую. При сжатии KV-кэша точность FastKVZip упала с 0,93 до 0,35. Агент-разработчик ответил распределением доступной памяти между участками контекста, чтобы середина не проигрывала концовке при глобальном отборе.

Слабые места искали в четырёх задачах эффективного вывода: сжатии KV-кэша, разреженном внимании, разреженной генерации видео и расширении контекста. Полный цикл с доработкой алгоритма показали только для сжатия на Qwen3-4B и расширения контекста на Llama3-8B, в обоих случаях при четырёхкратном изменении исходного режима. Поэтому работа пока показывает применимость подхода к алгоритмам с программно проверяемым результатом, а не универсального автономного исследователя.

Источники

Иллюстрация: рисунок из статьи «Generative Adversarial Loops», Kislay Aditya Oj, Nidhi Jain, Sri Surya Varma Datla и др., CC BY-SA 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу