Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Запросы к LLM научились переносить со смартфона на пограничный сервер или в облако с учётом нагрева устройства и сложности задачи. В препринте Simran Koul, который не прошёл рецензирование и содержит замеры самого автора, HybridInfer обошёл две ручные эвристики по качеству при минимальной стоимости среди адаптивных вариантов. Для мобильного продукта это аргумент не считать локальную модель единственным рабочим контуром даже на флагманском устройстве.
Маршрут определяют нагрев и сложность запроса
HybridInfer выбирает один из трёх уровней. На смартфоне работает Llama 3.2 3B, на пограничном сервере в локальной сети — Llama 3.1 8B с поиском по базе документов, в облаке — GPT-4o.
Маршрутизатор получает два признака. Первый — тепловой запас из Android API: система оценивает, насколько устройство приблизилось к порогу сильного ограничения частоты из-за нагрева. Второй — сложность запроса, которую определяют по длине текста и словам, указывающим на многошаговое рассуждение.
Тепловой запас делят на пять диапазонов, сложность — на три. Их сочетания образуют 15 состояний, для каждого из которых табличное Q-обучение выбирает локальную модель, пограничный сервер или облако. Политику обучают заранее, поэтому на смартфоне не нужен отдельный обучающий контур: приложение загружает готовую таблицу и выбирает действие с наибольшей оценкой.
Награда учитывает качество ответа, задержку, денежную стоимость и приближение к тепловому порогу. Отдельный бонус начисляют за выполнение на устройстве: он представляет приватность, автономную работу и отсутствие платы за запрос.
Этот бонус оказался необходим не только для настройки баланса. Без него маршрутизатор всегда выбирал сервер или облако: они отвечали быстрее, давали сопоставимое качество и не нагревали телефон. В такой функции награды показания теплового датчика вообще не влияют на решение.
Локальная модель упирается не только в снижение частоты
Работу проверяли на Samsung Galaxy S25+ с Snapdragon 8 Elite. Локальная модель запускалась через MLC-LLM и OpenCL, пограничная — на рабочей станции в локальной сети. Набор включал 210 технических запросов разной сложности, а ответы сравнивали с заранее сохранёнными эталонами Claude Opus 4.8 с помощью метрики семантического сходства BERTScore-F1.
На коротких и средних запросах локальная Llama давала качество, близкое к остальным уровням. Но один такой ответ занимал около 29 секунд, тогда как HybridInfer справлялся примерно за 9 секунд, поскольку чаще переносил работу с телефона.
При последовательном выполнении проблема становилась серьёзнее обычного замедления. Приложение завершалось с ошибкой или переставало отвечать уже после нескольких локальных запросов, а длинные запросы зависали на этапе обработки входного текста. В журналах сбоев видны ошибки компиляции OpenCL, загрузки драйвера и среды MLC-LLM.
Сбои повторялись и на остывшем устройстве. Поэтому тепловой сигнал здесь служит полезным индикатором нагрузки, но не описывает причину целиком: текущий программный стек мобильного GPU сам остаётся источником нестабильности.
HybridInfer показал статистически значимо более высокое качество, чем маршрутизация только по сложности и ручное правило с тепловым порогом. При этом он стоил меньше других адаптивных вариантов. Однако обученный маршрутизатор тоже иногда падал, когда отправлял запрос на уже нагретый телефон, поэтому часть его прогонов осталась незавершённой.
Локальный контур стоит проектировать как предпочтение, а не обязанность
Работа меняет планы команд, которые рассчитывают обслуживать мобильный ИИ целиком на устройстве. Даже если модель помещается в память и хорошо отвечает на одиночном запросе, это ещё не подтверждает устойчивость длинной сессии. Нагрузочный тест должен включать последовательные запросы, длинный входной текст, нагретое устройство и повторный запуск после сбоя.
Практическая архитектура следует из двух сигналов HybridInfer. Сложность запроса показывает, хватит ли локальной модели, а тепловой запас — выдержит ли устройство ещё одну задачу. Для продукта также нужен запасной маршрут при зависании среды выполнения, поскольку один тепловой порог не ловит ошибки драйвера.
В функции выбора придётся явно оценить пользу локальной обработки. Если учитывать только качество, задержку и серверную цену, оптимизатор закономерно вынесет все запросы с телефона. Приватность, автономность и запрет на передачу отдельных данных должны стать измеримыми условиями или отдельной наградой, иначе заявленная локальная стратегия исчезнет при обучении.
Результат пока очерчивает направление, а не даёт переносимый порог нагрева. Проверка охватывает одну модель смартфона, один программный стек и созданный для эксперимента набор технических запросов; часть прогонов маршрутизатора не завершилась. Перед внедрением команде нужно повторить замеры на своих устройствах, версиях драйверов и реальном распределении запросов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



