Ornith-1.5-9B – модель на 9 млрд параметров семейства Qwen3.5. Она поддерживает рассуждения, работу с изображениями, вызов инструментов и контекст до 262 144 токенов. Для локального запуска уже опубликована версия Ornith-1.5-9B-uncensored с существенно ослабленными ограничениями и готовыми GGUF-квантами.
Запустить её можно без компьютера – непосредственно на Android или iPhone.
📌 1. Устанавливаем PocketPal AI
PocketPal AI запускает GGUF-модели непосредственно на смартфоне через
llama.cpp. После загрузки модели интернет для работы не нужен.🔻 Android:
PocketPal AI – Google Play
🔻 iPhone / iPad:
PocketPal AI – App Store
Приложение бесплатное и имеет открытый исходный код. Оно умеет искать и скачивать GGUF непосредственно с Hugging Face.
📌 2. Находим Ornith
Открываем:
☰ Menu – Models + Add from Hugging Face
В поиске вводим:
mradermacher/Ornith-1.5-9B-uncensored-GGUF
Репозиторий:
Ornith-1.5-9B-uncensored-GGUF
📌 3. Выбираем размер модели
Для смартфона с 8 Гбайт ОЗУ лучше начать с:
Q3_K_S — около 4,4 Гбайт
Если телефон закрывает приложение или памяти не хватает:
Q2_K — около 3,9 Гбайт
Для устройств с 12–16 Гбайт ОЗУ уже можно брать:
Q4_K_S — около 5,5 Гбайт
Q4_K_M — около 5,7 Гбайт
Именно Q4_K_S и Q4_K_M рекомендуемые по соотношению скорости и качества.
📌 4. Настраиваем перед запуском
После скачивания нажимаем Load.
На телефоне с 8 Гбайт не нужно сразу выставлять заявленные 262K контекста. Начинаем с:
Context Size: 4096
Если всё работает стабильно:
8192
Большой контекст требует дополнительной оперативной памяти под KV-кэш, поэтому на смартфоне максимальное окно модели практически не нужно.
📌 5. Запускаем
После загрузки:
Load — Chat — пишем запрос
Всё. Ornith выполняется не в облаке, а непосредственно на процессоре телефона. PocketPal поддерживает CPU, Metal на iPhone, а на Android
— аппаратное ускорение на совместимых устройствах.Для 8 Гбайт ОЗУ оптимальная стартовая конфигурация:
Ornith-1.5-9B-uncensored
Q3_K_S ≈ 4,4 Гбайт
Context: 4096–8192
PocketPal AI
То есть полноценную 9B-модель с рассуждениями можно носить прямо в смартфоне – без Ollama, LM Studio, сервера и постоянного подключения к интернету.
🔻 Мультимодальность
Отдельно доступны файлы
mmproj:mmproj-Q8_0 — около 0,7 Гбайт
mmproj-f16 — около 1,0 Гбайт
Они нужны для работы модели с изображениями. На телефоне с 8 Гбайт ОЗУ сначала лучше проверить обычный текстовый режим, а уже затем подключать обработку изображений.
