TGViewer
Человек 2.0 Человек 2.0 @human20 · 1.37K subscribers
Post #302 370
Gemma 4 проверили на реальные задачи Hermes

Вышла Gemma 4. Я попросил Hermes прогнать её через наши рабочие воркфлоу. Без абстрактных бенчмарков со чпагетти-графиками: три модели, один набор заданий.
⠀
Модели:
┈ локальная Gemma 4 от Google
┈ minimax M3 reasoning high
┈ GPT 5.5 reasoning medium
⠀
Задачи приземлённые: разобрать лог Telegram gateway, выбрать нужные skills, вычистить приватные куски из промпта, составить debug-план, написать короткий отчёт в моём стиле, решить, молчать cron watchdog или слать alert.
⠀
GPT 5.5: лучший финальный мозг. Там, где production config, риск сломать gateway, приватные куски или ответ человеку, он заметно точнее. Лучше держит контекст, меньше фантазирует, аккуратнее формулирует.
⠀
Minimax M3: рабочая лошадь. Нормально тянет маршрутизацию, суммаризацию логов, watchdog, короткие технические выводы. Слабое место: иногда слишком много токенов уходит во внутреннее reasoning, и при маленьком лимите наружу прилетает пустой ответ. Значит, нужны правильные лимиты и её роль это background-модель.
⠀
Gemma 4 локально: полезная, но это конечно не главный агент. Для дешёвой классификации, первичного summary и локального профильтра пойдёт. На задачах с контекстом Hermes Agent, privacy или с точным стилем письма быстро начинает плыть. На короткий запрос про Hermes она, например, решила, что речь про доставку и посылки 🤷
⠀
Итого по ролям:
┈ Gemma 4 — дешёвый пре-фильтр
┈ Minimax M3 — дешёвый background-мозг
┈ GPT 5.5 — финальный judge и executor
⠀
Локальные модели уже можно ставить в работу: резать шум, сортировать задачи, сжимать логи, ловить приватные фрагменты, а наверх отдавать только то, где нужен дорогой мозг. Рабочая архитектура агента: связка моделей под разные уровни риска, а не попытка заставить одну модель делать всё.

А вот ждать от локальных моделей фронтир-поведения пока не приходится.

🧱🔧🧬📈💎🟣🟢

Кейсы и инструменты: @human20
Среда ИИ: human20.app
More from @human20
  1. Oct 2, 2026Gemini 4 Argon: миллион токенов на ответ по стартовой цене Sol Google представила Gemini 4…
  2. Oct 2, 2026POV: вайбкодер, который не даёт полный доступ codex и апрувит каждый запрос агента вручную
  3. Oct 1, 2026DLSS — теперь для фото и видео из своей папки Обычно за DLSS идёшь в настройки игры. В Vis…
  4. Sep 30, 2026«Гермес, ну продолжай» Странная работа — напоминать ИИ-агенту, чтобы он работал. Поручаешь…
  5. Sep 30, 2026​🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨�…
  6. Sep 30, 2026OpenAI сделала нам рабочую лошадку Ещё один релиз OpenAI — и первая реакция: что они там о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →