Инженер Google Кормак Брик объяснил, как дообучить крошечную LLM прямо на телефоне и повысить её точность с 46% до 90%.
Схема такая:
1. Выбрать Gemma 270M.
2. Сгенерировать синтетические данные для своей задачи.
3. Дообучить модель с помощью LoRA.
4. Квантизировать её до int4.
5. Развернуть на Pixel и получить скорость до 2000 токенов в секунду.
Именно благодаря такому циклу модель на 270 млн параметров может превзойти модель на 70 млрд параметров в конкретной задаче - при этом полностью работать офлайн прямо у вас в кармане.
> ютуб
Post #3515
19.9K