Неделю назад я услышал в подкасте идею о создании клавиатуры в максимусе, которая подсвечивает статью и срок, как промо-акция к парковочному мессенджеру. И решил действовать на опережение)
Встал вопрос как же создать такое приложение. Ведь безопасность было главным приоритетом. Ну и, конечно ваши дорогие моему сердцу хихи. Решением, которое сразу пришло мне в голову, была маленькая локальная модель, работающая прямо на устройстве, и клавиатура с одной строкой.
При выборе LLM-модели я сравнил самые популярные <1B параметров модели, тк примерный вес модели (в ГБ) равен кол-ву параметров (нейронов) * 2. Соответственно 1B * 2 = 2ГБ — высшая граница, за которой приложение apk не опубликуют нигде, как слишком большое по гигабайтам.
На этом этапе выиграл Qwen (я и не сомневался), тк этот китаец лучше всего работает с русским языком при обучении (т. е. они одни из немногих кто вообще держит в голове Россию при создании своих моделей). А конкретный выбор был между Qwen 3 0.6B и Qwen 3.5 0.8B. Победила дружба в виде модели Qwen 3.5 - 0.6B)
Но и это еще не все. На компьютере эта модель модель отвечала за 4 секунды, а на моем старом телефоне за 20-25 сек.
«Надо ускорять», — подумал я.
«Надо пихать ему LoRa», — подумал мой кодинг‑агент.
«Мы справимся умным промптингом», — ответил я.
Взял квантизацию модели, отключил ризонинг и сделал triggers.json.
Следующая часть тут