🐈 Решил заняться своим старым проектом «ScreenCat».
Вот, например, старый пост: https://t.me/prefire_ios/116
Обновил llama.cpp, полностью ушел от LLM.swift к самописному (ага, конечно, навайбкоденному 😁) бриджу на Swift со всеми новыми фишками, типа спекулятивного выполнения и так далее.
Но это не главное. У кота сейчас модель довольно большая - Qwen 3.5 2B или 4B на выбор. Это нагружает компьютер.
Вот решил выбрать модель поменьше, MiniCPM 1B, и дообучить её через LoRA под конкретную задачу. В этом помогла как раз ИИшка.
Из этапов, без большого погружения, выглядит так:
1. Сначала качаем модель.
2. Потом нужно найти или сгенерировать датасет. Так как мне нужны фразы котика, такого датасета я не нашел. Так что с помощью другой модели (Qwen 3.6 35B) начал генерацию. Если интересно, что и как, могу сделать отдельный пост.
3. Дальше с помощью датасета и самой маленькой модели обучаем её. Одна команда в терминале, сам удивлен, что так легко.
4. Наслаждаемся результатом 😁
На самом деле результат очень плохой 🤡
Буду копать, что не так. Вроде датасет сам нормальный. Возможно, модель все же слишком маленькая, или я обучаю как-то не так, или параметры LoRA выбрал фиговые.
Буду рад послушать предложения и исправления.
Post #173
984