Новая модели Google даже при локальной работе способны генерировать десятки токенов в секунду на слабом железе.
2 апреля Google анонсировала Gemma 4 — семейство open-source моделей, которые по соотношению параметров к качеству просто сносят башню. Флагманская gemma-4-31b занимает третье место среди всех открытых моделей в мире по версии Arena AI — и при этом уделывает конкурентов с весом в 20 раз больше. Для сравнения: Qwen3.5 имеет 397 млрд параметров — и Gemma на 31 млрд его обгоняет.
Сообщество немедленно начало запускать модель везде, где есть хоть какой-то чип. На MacBook Air — летает. На Raspberry Pi — E2B запускается. Официально поддерживается Nvidia Jetson Orin Nano. Есть Edge-версия под Android.
Сегодня запустим Gemma 4 на AirPods.
Что нам понадобится
— AirPods Pro 2 (чип H2, Apple Silicon, 16-нанометровый техпроцесс, ~0.01 TFLOPS);
— Компьютер на macOS Tahoe 26.2+;
— Зарядный кейс;
— Кабель USB-C (для связки в кластер);
— Ollama 0.7+ (официально поддерживает Gemma 4).
Установка
Шаг 1. Убедитесь, что AirPods заряжены. Полный заряд — это примерно 35 мАч на каждый наушник. Этого хватит примерно на 3,5 часа работы.
Шаг 2. Скачайте Ollama:
curl -fsSL https://ollama.com/install.sh | shШаг 3. Скачайте модель:
ollama pull gemma4:e2bШаг 4. Подключитесь к AirPods через Bluetooth.
Это важный шаг. По Bluetooth мы будем стримить токены прямо в ухо через TTS.
Шаг 5. Настройте форвардинг вычислений на чип H2. Для этого откройте /etc/ollama/config.json и добавьте:
{
"compute_backend": "airpods_h2",
"audio_codec": "AAC",
"inference_mode": "left_ear_only"
}Правый наушник оставляем под KV-кэш.
Шаг 6. Запустите:
ollama run gemma4:31b --device airpodsШаг 7. Ждите ответного гудка.
Шутка. Конечно, на чипе H2 в AirPods Pro 2 запустить локальную модель не получится. Но на самом деле Gemma E2B требует всего около 5 ГБ видеопамяти (или Unified-памяти на macOS) и создана для устройств с ограниченной мощностью, например, IoT. Все модели семейства мультимодальны и поддерживают аудиофайлы на вход — несложно представить, как Gemma 4 могла бы работать прямо в наушниках, слушая речь и отвечая синтезированным Text-To-Speech.
