Я давно слежу за edge-моделями, мне интересно куда это всё вырулит и когда у нас с вами появится возможность, без привязки к сети, задать любой вопрос, а главное получить на него осмысленный ответ. И вот вышла новая модель, всего на 270 млн параметров (для масштаба: у флагманов сотни миллиардов, а точные цифры по GPT-5 OpenAI публично не раскрывает 🫤), которая вполне бодро бегает даже на среднем смартфоне.
Google представил Gemma 3 270M — компактную модель, изначально заточенную под дообучение на конкретные задачи и работу он-девайс. Из коробки она неплохо следует инструкциям и умеет приводить текст к структуре.
Почему это важно для он-девайс:
Энергоэффективность: INT4-квантованная версия на Pixel 9 Pro «съела» ~0,75% батареи на 25 диалогов.
Сильная база для дообучения: из 270M параметров 170M эмбеддинги (большой словарь 256k), 100M трансформер → устойчивее к «редким» токенам и доменной лексике.
Готовность к продакшену: есть QAT-чекпоинты под INT4, чтобы не терять качество при квантовании.
Куда прикручивать прямо сейчас:
классификация, извлечение сущностей/фактов, маршрутизация запросов, нормализация текста.
Там, где важны миллисекунды и цена инференса. Плюс приватные кейсы, т.к. всё крутится локально.
Найти все ссылки на скачивание и тестов можно в оригинальной статье.
Мой вывод: мы ускоряемся к модели из множества маленьких спецов вместо одного гиганта.
Gemma 3 270M отличное начало, чтобы собрать быстрые, дешёвые и приватные пайплайны прямо на устройстве.
——————————————
Что дальше у меня: решил прикинуть, как поднять эту модельку на своём сервере умного дома и интегрировать в автоматизации.
Хочу протестить:
- офлайн-ассистента для рутинных команд (свет, климат, сцены) с вежливыми подтверждениями
- извлечение структурированных событий из логов устройств (датчик -> значение -> время») для дашбордов
- умную маршрутизацию запросов: что решаем локально, а что (при необходимости) отдаём в облако
- короткие локальные дайджесты "что произошло в доме за день".
Если получится интересно, соберу заметки по конфигам и бенчмаркам.
UPD:
запустил через ollama на своём 4 ядерном CPU, скорость 130 токенов в секунду, с этим можно работать)
#AI #edge #Gemma3 #Google #LLM #SmartHome
