Чат с языковыми моделями, расшифровка голосовых заметок и генерация изображений — всё считается на самом устройстве. Без аккаунта, подписки и телеметрии. Наше собственное приложение в App Store.

Почти все AI-приложения устроены одинаково: интерфейс на телефоне, вычисления на чужом сервере. Вместе с запросом туда уезжают переписка, записи разговоров и всё, что человек хотел бы оставить при себе.
Перевернуть схему. Модель скачивается один раз и работает на самом устройстве через MLX и Apple Silicon. После загрузки приложение работает в авиарежиме, аккаунт для этого не нужен.
Для тех, у кого в заметках и переписке есть то, что нельзя отдавать наружу. И для тех, кому не нравится платить подписку за чат, который и так помещается в телефон.
Каждая функция работает без сети после загрузки модели. Что именно доступно, зависит от памяти устройства — и приложение говорит об этом заранее.
Одиннадцать открытых моделей — от лёгкой Qwen 3.5 2B до Gemma 3 12B — и Apple Intelligence без загрузки. Ответ появляется по словам, история хранится только на устройстве.
Запись, расшифровка на 30 языках моделью Qwen3 ASR и краткое содержание длинной записи — всё на устройстве. Аудио можно принести из Files или через «Поделиться» из любого приложения.
SDXL Turbo рисует изображение за два шага прямо на iPhone или iPad с 8 ГБ памяти и больше. Промпт на любом языке переводится локально перед генерацией.
Приложение определяет память устройства и показывает только те модели, которые на нём заработают. Загрузки идут в фоне, переживают перезапуск и проверяют место на диске.
Самое сложное в onLM не интерфейс, а память: iOS выдаёт приложению 3–4 ГБ, а одна модель весит от полутора до семи. Вот что для этого сделано.
Чат, распознавание речи и генерация картинок никогда не живут в GPU одновременно. Перед каждым запуском предыдущая модель выгружается, а после каждой генерации освобождается пул аллокатора MLX.
Устройства делятся на 6, 8, 12 и 16 ГБ. У каждой модели есть свой минимум, а рекомендация на онбординге зависит от того, что в руках у пользователя.
На 12-гигабайтных устройствах модели у верхней границы тира держат KV-кэш в 8 бит и ограничивают длину ответа — чтобы третий ход диалога не убил приложение.
Файлы по несколько гигабайт качаются фоновой URLSession, переживают перезапуск, проверяют HTTP-статус и место на диске, а битые файлы перекачиваются сами.
Apple Foundation Models там, где доступен Apple Intelligence, и MLX для открытых моделей. Для интерфейса это один протокол с потоком событий генерации.
Аудио приходит из любого приложения через «Поделиться» и из Files. Расширение складывает файл в общий контейнер, приложение забирает его и сразу расшифровывает.
Каталог моделей в версии 1.4.2. Размер — объём загрузки, память — минимум устройства.
| Модель | Тип | Размер | Память от |
|---|---|---|---|
| Apple Intelligence | Чат | встроена | где есть Apple Intelligence |
| Qwen 3.5 2B | Чат | ~1,5 ГБ | 6 ГБ |
| Qwen 3.5 4B | Чат | ~2,5 ГБ | 8 ГБ |
| Qwen 3.5 9B | Чат | ~5,5 ГБ | 12 ГБ |
| Gemma 3 4B | Чат | ~2,5 ГБ | 8 ГБ |
| Gemma 3 12B | Чат | ~7 ГБ | 16 ГБ |
| Gemma 4 E2B | Чат | ~3,6 ГБ | 8 ГБ |
| Gemma 4 E4B | Чат | ~5,2 ГБ | 12 ГБ |
| Llama 3.2 3B | Чат | ~2 ГБ | 6 ГБ |
| Llama 3.1 8B | Чат | ~4,5 ГБ | 12 ГБ |
| Phi 4 Mini | Чат | ~2,5 ГБ | 8 ГБ |
| Mistral 7B v0.3 | Чат | ~4 ГБ | 12 ГБ |
| Qwen3 ASR 1.7B | Речь | ~2,3 ГБ | 6 ГБ |
| SDXL Turbo | Изображения | ~3 ГБ | 8 ГБ |





