Gemma 4 Technical Report
Gemma 4 - новая открытая мультимодальная линейка моделей Google.
Она умеет рассуждать, читать изображения, понимать аудио, работать с длинным контекстом и эффективно запускаться в разных размерах от 2.3B до 31B параметров.
Модели E2B и E4B с эффективным размером 2.3B и 4B примерно догоняют или обгоняют Gemma 3 27B, используя примерно в 10 раз меньше параметров.
Аудиоэнкодер стал на 78% меньше, а KV-cache для длинного контекста удалось сократить до 37.5%.
E4B даже обходит Gemma 3 27B на long-context benchmark RULER 128k: 86.6 против 66.0.
Интересная деталь: 12B-модель не использует отдельные vision и audio encoders. Вместо этого она напрямую подаёт image patches и audio chunks в LLM.
А 31B-модель стала лучшей dense open model в Arena Text. При этом 26B MoE активирует всего 3.8B параметров и всё равно набирает 1438 Elo.
https://www.alphaxiv.org/abs/2607.02770
Post #2863
3.94K

- 👍 7
- 🔥 7
- ❤ 4