TGViewer
A1intelligence — канал об искусственном интеллекте A1intelligence — канал об искусственном интеллекте @a1ntelligence · 1.78K subscribers
Post #724 740
Gemini 4 Argon: Google вернулись, но не все так радужно

Google показали Gemini 4 Argon — первое новое поколение Gemini почти за год. Сверили цифры Google с независимыми тестами, и вот что видно.

Область  Gemini 4 GPT-6 Fable 5.1 Opus 5.5
Кодинг 77.9* 74.1 67.4 74.2
Терминал 57.4 58.2 57.9 66.4*
Кибербез 68.0* 68.0* 58.0 67.0
Бизнес 68.9* 63.1 65.8 67.0
Видео 91.7* 87.5 79.7 83.7

* — лучший результат. Gemini 4 — это Argon, GPT-6 — Astra, Fable и Opus — модели Claude. Данные Google.

Сильнее всего — в работе с документами. Юриспруденция, финансы, автоматизация, длинные тексты и видео — здесь Argon номер один. На юридическом тесте от Harvey у него почти втрое больше, чем у ближайшего конкурента, хотя 19,6% — это всё ещё немного.

С кодом — неоднозначно. В долгих задачах по программированию у Argon рекорд, и независимые тесты Artificial Analysis (AA) это подтверждают. Но в работе с командной строкой он отстаёт от Claude Opus 5.5. В общем рейтинге кодинг-агентов AA он только третий — после Claude Sonnet 5.5 и Opus 5.5.

Реже выдумывает. По тестам AA Argon знает меньше фактов, чем GPT-6 Astra (50% против 63%), зато честнее признаётся, когда не знает. Не зная ответа, он выдумывает в 15% случаев, а Astra — в 51%.

По общему уровню интеллекта — наравне с GPT-6 Astra. В общем рейтинге AA у них одинаковые баллы, а прогон тестов на Argon стоит на 40% дешевле. Но это по стартовой цене со скидкой. Потом цена вырастет вдвое, и на тех же тестах Argon обойдётся дороже Astra.

Попробовать пока нельзя. Модель есть только у проверенных кибер-экспертов из программы Fairwind и на проверке у правительства США. Следующие в очереди — платные клиенты API и подписчики Google AI Ultra, но сроков нет. Похоже, это новая норма для топовых моделей: Anthropic так же сначала открыли Claude Mythos Preview только узкому кругу организаций.

Есть сомнения изнутри. Bloomberg пишет, что часть сотрудников Google недовольна тем, как модель справляется с реальной работой. Проверить это со стороны пока нельзя.

Итог. Google действительно вернулись в тройку лидеров. Но Argon — не «революция», модель явно хорошо показывает себя на бенчмарках, но общее ощущение в индустрии, что модель не сможет конкурировать с Opus или Astra, к моменту когда модель станет доступна.

Анонс Google · Тесты Artificial Analysis

#апдейтымоделей #исследования
  • 👍 5
  • 🤔 5
More from @a1ntelligence
  1. Oct 7, 2026OpenAI опубликовала 722 математические рукописи, созданные внутренней ИИ-моделью 😮 В подб…
  2. Oct 6, 2026Жесть: Claude сдал свою хозяйку полиции — девушка использовала нейронку в качестве дневник…
  3. Oct 6, 2026Claude научили превращать ваши PDF-файлы в интерактивные книги с анимациями и озвучкой 😮…
  4. Oct 6, 2026Anthropic лоббирует Ватикан по вопросу сознания ИИ После того как Папа Лев XIV заявил, что…
  5. Oct 5, 2026Искусственный интеллект помогает перезапускать японские АЭС Tokyo Electric Power Company (…
  6. Oct 5, 2026Топ-10 самых быстрорастущих Claude Skills за сентябрь — разработчик собрал список самых по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →