Google показали Gemini 4 Argon — первое новое поколение Gemini почти за год. Сверили цифры Google с независимыми тестами, и вот что видно.
Область Gemini 4 GPT-6 Fable 5.1 Opus 5.5
Кодинг 77.9* 74.1 67.4 74.2
Терминал 57.4 58.2 57.9 66.4*
Кибербез 68.0* 68.0* 58.0 67.0
Бизнес 68.9* 63.1 65.8 67.0
Видео 91.7* 87.5 79.7 83.7
* — лучший результат. Gemini 4 — это Argon, GPT-6 — Astra, Fable и Opus — модели Claude. Данные Google.
Сильнее всего — в работе с документами. Юриспруденция, финансы, автоматизация, длинные тексты и видео — здесь Argon номер один. На юридическом тесте от Harvey у него почти втрое больше, чем у ближайшего конкурента, хотя 19,6% — это всё ещё немного.
С кодом — неоднозначно. В долгих задачах по программированию у Argon рекорд, и независимые тесты Artificial Analysis (AA) это подтверждают. Но в работе с командной строкой он отстаёт от Claude Opus 5.5. В общем рейтинге кодинг-агентов AA он только третий — после Claude Sonnet 5.5 и Opus 5.5.
Реже выдумывает. По тестам AA Argon знает меньше фактов, чем GPT-6 Astra (50% против 63%), зато честнее признаётся, когда не знает. Не зная ответа, он выдумывает в 15% случаев, а Astra — в 51%.
По общему уровню интеллекта — наравне с GPT-6 Astra. В общем рейтинге AA у них одинаковые баллы, а прогон тестов на Argon стоит на 40% дешевле. Но это по стартовой цене со скидкой. Потом цена вырастет вдвое, и на тех же тестах Argon обойдётся дороже Astra.
Попробовать пока нельзя. Модель есть только у проверенных кибер-экспертов из программы Fairwind и на проверке у правительства США. Следующие в очереди — платные клиенты API и подписчики Google AI Ultra, но сроков нет. Похоже, это новая норма для топовых моделей: Anthropic так же сначала открыли Claude Mythos Preview только узкому кругу организаций.
Есть сомнения изнутри. Bloomberg пишет, что часть сотрудников Google недовольна тем, как модель справляется с реальной работой. Проверить это со стороны пока нельзя.
Итог. Google действительно вернулись в тройку лидеров. Но Argon — не «революция», модель явно хорошо показывает себя на бенчмарках, но общее ощущение в индустрии, что модель не сможет конкурировать с Opus или Astra, к моменту когда модель станет доступна.
Анонс Google · Тесты Artificial Analysis
#апдейтымоделей #исследования