Проект студии · iOS · в App Store

onLM — AI, который живёт на вашем iPhone, а не в облаке.

Чат с языковыми моделями, расшифровка голосовых заметок и генерация изображений — всё считается на самом устройстве. Без аккаунта, подписки и телеметрии. Наше собственное приложение в App Store.

Скачать в App Store
В App Storeс 24 марта 2026 · v1.4.2
ПлатформыiPhone · iPad · Mac · Vision
Приватностьданные не собираются
Экран чата onLM: модель Qwen3.5 4B отвечает прямо на устройстве
Задача

Сделать AI, которому не нужно облако.

Зачем

Почти все AI-приложения устроены одинаково: интерфейс на телефоне, вычисления на чужом сервере. Вместе с запросом туда уезжают переписка, записи разговоров и всё, что человек хотел бы оставить при себе.

Что решили

Перевернуть схему. Модель скачивается один раз и работает на самом устройстве через MLX и Apple Silicon. После загрузки приложение работает в авиарежиме, аккаунт для этого не нужен.

Для кого

Для тех, у кого в заметках и переписке есть то, что нельзя отдавать наружу. И для тех, кому не нравится платить подписку за чат, который и так помещается в телефон.

Что умеет

Три инструмента и каталог моделей.

Каждая функция работает без сети после загрузки модели. Что именно доступно, зависит от памяти устройства — и приложение говорит об этом заранее.

Чат

Разговор с моделью, которая лежит в кармане

Одиннадцать открытых моделей — от лёгкой Qwen 3.5 2B до Gemma 3 12B — и Apple Intelligence без загрузки. Ответ появляется по словам, история хранится только на устройстве.

Голос

Диктофон, который сам пишет конспект

Запись, расшифровка на 30 языках моделью Qwen3 ASR и краткое содержание длинной записи — всё на устройстве. Аудио можно принести из Files или через «Поделиться» из любого приложения.

Изображения

Картинка по описанию, не выходя в сеть

SDXL Turbo рисует изображение за два шага прямо на iPhone или iPad с 8 ГБ памяти и больше. Промпт на любом языке переводится локально перед генерацией.

Модели

Каталог, который знает ваше устройство

Приложение определяет память устройства и показывает только те модели, которые на нём заработают. Загрузки идут в фоне, переживают перезапуск и проверяют место на диске.

Под капотом

Гигабайтные модели в бюджете 3–4 ГБ.

Самое сложное в onLM не интерфейс, а память: iOS выдаёт приложению 3–4 ГБ, а одна модель весит от полутора до семи. Вот что для этого сделано.

Одна модель в памяти

Чат, распознавание речи и генерация картинок никогда не живут в GPU одновременно. Перед каждым запуском предыдущая модель выгружается, а после каждой генерации освобождается пул аллокатора MLX.

Тиры по памяти

Устройства делятся на 6, 8, 12 и 16 ГБ. У каждой модели есть свой минимум, а рекомендация на онбординге зависит от того, что в руках у пользователя.

Квантованный KV-кэш

На 12-гигабайтных устройствах модели у верхней границы тира держат KV-кэш в 8 бит и ограничивают длину ответа — чтобы третий ход диалога не убил приложение.

Фоновые загрузки

Файлы по несколько гигабайт качаются фоновой URLSession, переживают перезапуск, проверяют HTTP-статус и место на диске, а битые файлы перекачиваются сами.

Два бэкенда

Apple Foundation Models там, где доступен Apple Intelligence, и MLX для открытых моделей. Для интерфейса это один протокол с потоком событий генерации.

Share Extension и импорт

Аудио приходит из любого приложения через «Поделиться» и из Files. Расширение складывает файл в общий контейнер, приложение забирает его и сразу расшифровывает.

Стек

Нативно, без обёрток.

  • Swift
  • SwiftUI
  • SwiftData
  • MLX · mlx-swift-lm
  • Apple Foundation Models
  • swift-transformers
  • Share Extension
  • App Groups
  • Background URLSession
  • iOS 26 · iPadOS 26
  • 6 языков интерфейса

Каталог моделей в версии 1.4.2. Размер — объём загрузки, память — минимум устройства.

МодельТипРазмерПамять от
Apple IntelligenceЧатвстроенагде есть Apple Intelligence
Qwen 3.5 2BЧат~1,5 ГБ6 ГБ
Qwen 3.5 4BЧат~2,5 ГБ8 ГБ
Qwen 3.5 9BЧат~5,5 ГБ12 ГБ
Gemma 3 4BЧат~2,5 ГБ8 ГБ
Gemma 3 12BЧат~7 ГБ16 ГБ
Gemma 4 E2BЧат~3,6 ГБ8 ГБ
Gemma 4 E4BЧат~5,2 ГБ12 ГБ
Llama 3.2 3BЧат~2 ГБ6 ГБ
Llama 3.1 8BЧат~4,5 ГБ12 ГБ
Phi 4 MiniЧат~2,5 ГБ8 ГБ
Mistral 7B v0.3Чат~4 ГБ12 ГБ
Qwen3 ASR 1.7BРечь~2,3 ГБ6 ГБ
SDXL TurboИзображения~3 ГБ8 ГБ
Экраны

Как это выглядит.