Gemma - это семейство открытых небольших больших (что?) языковых моделей от Google. C неймингом там проблемы, и местами Gemma называется в некоторых продуктах Google Gemini.
Веса доступны и открыты, а значит всё доступно для локального запуска на своём железе. Модели доступны под лицензией Apache 2.0!
Проще всего понимать это так: модель можно свободно брать, запускать, менять и встраивать в свои продукты, включая коммерческие, если соблюдать несколько базовых условий лицензии.
Мне больше всего интересны в этом посте плотная модель на 31B и 26B A4B MoE.
Первая просто невероятно умна для своего размера.
На arena.ai в text-to-text рейтинге располагается выше Gemini-2.5 Pro и Opus 4.1, а также прям под claude-sonnet-4-5. Ну лучший бенчмарк, но тем не менее.
С более серьёзными бенчмарками пришлось покопаться, но путём объединения бенчмарков из карточек моделей Gemma 4, Qwen-3.5, GPT-4.1 вышло что-то наглядное (второе фото).
Gemma 4 31B на первом месте по MMLU среди перечисленных мной моделей, обходя даже GPT o1 и GPT-5 mini!
MMLU (Massive Multitask Language Understanding) — это один из самых популярных и авторитетных эталонных тестов (бенчмарков) для оценки возможностей больших языковых моделей.
Его основная задача — измерить, насколько модель «умная» и «эрудированная», проверяя её знания в самых разных дисциплинах, от начальной школы до профессионального уровня.
Из бенчмарков видно, что у модели, которая запускается на обычном ПК пользовательского пошиба, уровень знаний сравним с топовыми большими LLM прошлых поколений и текущими бесплатными моделями и превосходит OpenAI GPT-OSS-120B, предыдущую серьёзную опенсорсную модель от основных игроков рынка (не считая Китая).
Это не говоря уже о классической прекрасной поддержке русского языка у Gemma\Gemini моделей.
На моём ПК с 13600K/32Gb DDR5/4070 Ti S 16GB просто при запуске "в лоб" в LM Studio:
- 31B в квантизации Q6_K выдаёт ~3 ток\сек при хорошем качестве ответов (хотя замороченный вопрос по Python она сама не расколола на 100%) - пришлось подсказать.
- 26A4B в квантизации Q6_K выдаёт ~14.5 ток\сек. Ответы похуже, но тоже очень приличные.
Из нюансов - thinking режим в LM Studio включается для этой модели с проблемами (скорее не включается), хотя в Ai Studio у Гугла всё работает.
Google опять всех переиграл (это продлится пару недель).
Ну и имаджинируйте состояние российского AI - локальная модель значительно мощнее и адекватнее всех гигачатов и Алис.
Google AI Studio
LM Studio
Hugging Face


