TGViewer
Full-time nerd Full-time nerd @ftbore · 610 subscribers
Post #2113 326
Пару недель назад Google выпустил новые модели семейства Gemma под номером 4.

Gemma - это семейство открытых небольших больших (что?) языковых моделей от Google. C неймингом там проблемы, и местами Gemma называется в некоторых продуктах Google Gemini.

Веса доступны и открыты, а значит всё доступно для локального запуска на своём железе. Модели доступны под лицензией Apache 2.0!

Проще всего понимать это так: модель можно свободно брать, запускать, менять и встраивать в свои продукты, включая коммерческие, если соблюдать несколько базовых условий лицензии.

Мне больше всего интересны в этом посте плотная модель на 31B и 26B A4B MoE.

Первая просто невероятно умна для своего размера.
На arena.ai в text-to-text рейтинге располагается выше Gemini-2.5 Pro и Opus 4.1, а также прям под claude-sonnet-4-5. Ну лучший бенчмарк, но тем не менее.

С более серьёзными бенчмарками пришлось покопаться, но путём объединения бенчмарков из карточек моделей Gemma 4, Qwen-3.5, GPT-4.1 вышло что-то наглядное (второе фото).

Gemma 4 31B на первом месте по MMLU среди перечисленных мной моделей, обходя даже GPT o1 и GPT-5 mini!

MMLU (Massive Multitask Language Understanding) — это один из самых популярных и авторитетных эталонных тестов (бенчмарков) для оценки возможностей больших языковых моделей.

Его основная задача — измерить, насколько модель «умная» и «эрудированная», проверяя её знания в самых разных дисциплинах, от начальной школы до профессионального уровня.


Из бенчмарков видно, что у модели, которая запускается на обычном ПК пользовательского пошиба, уровень знаний сравним с топовыми большими LLM прошлых поколений и текущими бесплатными моделями и превосходит OpenAI GPT-OSS-120B, предыдущую серьёзную опенсорсную модель от основных игроков рынка (не считая Китая).

Это не говоря уже о классической прекрасной поддержке русского языка у Gemma\Gemini моделей.

На моём ПК с 13600K/32Gb DDR5/4070 Ti S 16GB просто при запуске "в лоб" в LM Studio:

- 31B в квантизации Q6_K выдаёт ~3 ток\сек при хорошем качестве ответов (хотя замороченный вопрос по Python она сама не расколола на 100%) - пришлось подсказать.
- 26A4B в квантизации Q6_K выдаёт ~14.5 ток\сек. Ответы похуже, но тоже очень приличные.

Из нюансов - thinking режим в LM Studio включается для этой модели с проблемами (скорее не включается), хотя в Ai Studio у Гугла всё работает.

Google опять всех переиграл (это продлится пару недель).

Ну и имаджинируйте состояние российского AI - локальная модель значительно мощнее и адекватнее всех гигачатов и Алис.

Google AI Studio
LM Studio
Hugging Face
  • 👍 12
  • 🤯 1
More from @ftbore
  1. Sep 28, 2026Сегодня узнал, что до пенсии мне осталось 34 года, 5 месяцев и 25 дней работы Это дольше,…
  2. Sep 25, 2026РИА Новости сегодня опубликовало материал с заголовком «Россию ждёт ещё одна СВО. Она буде…
  3. Sep 22, 2026Я не успел воспользоваться GPT-6 Astra, а Anthropic выпускают Claude Opus 5.5, а OpenAI —…
  4. Sep 22, 2026Потратил только что несколько часов на то, чтобы перенастроить своим близким VPN Адрес мое…
  5. Sep 21, 2026Прошло уже более месяца с того момента, как родилась наша дочь и я могу сказать что всё...…
  6. Aug 30, 2026Сегодня я узнал испанский аналог фразы "Один раз - не пидорас" "Una vez al año no hace dañ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →