Gemini 4 Argon: що Google показав в офіційному анонсі
30 вересня Google DeepMind представив Gemini 4 Argon — нову фронтирну модель для довгих багатокрокових задач: розробки ПЗ, корпоративної аналітики (право, фінанси) і кіберзахисту.
Доступ
Зараз модель отримують лише перевірені кіберзахисники в програмі Fairwind. Google називає це поетапним запуском і бере участь у добровільній процедурі уряду США з передрелізного доступу до моделей. Наступні в черзі — платні API-клієнти та передплатники Google AI Ultra. Дати немає.
1 млн вихідних токенів Ліміт генерації збільшили з 64K до 1M. Модель може думати й генерувати сотні тисяч токенів в одній траєкторії і закривати складну задачу за один прохід.
Внутрішнє використання в Google
Квантові обчислення: оптимізація ресурсів підпрограм (кубіти × гейти). В одному кейсі на 40% краще за опублікований бейзлайн, і це за лічені хвилини.
Дата-центри: агенти проаналізували телеметрію й автономно застосували оптимізації пам'яті. Уже звільнено понад 300 TiB, загальна оцінка економії — від 500 TiB до 1 PiB.
Міграція C/C++ на Rust: від re2 і libgav1 до ядра Zircon у Fuchsia (800K+ рядків). Перед продакшном код проходить автоматичний і ручний аудит. У libgav1 агенти замінили 32K рядків SIMD у наявному Rust-порті, і декодер став у 2,7 раза швидшим за попередню Rust-версію з ідентичним виводом.
Бенчмарки
DeepSWE v1.1 — 77,9%, SOTA для довгих інженерних задач.
Лідер Vals Index (фінанси, код, право, податки).
AutomationBench від Zapier — перше місце, 51,3%.
LVBench (довгі відео) — 91,7%, SOTA.
Кіберзахист
Argon автономно знаходить, валідує та патчить критичні вразливості. Перевіреним захисникам і внутрішнім командам Google модель видають без кіберобмежень.
Wiz у програмі Scan for Good знайшов з її допомогою критичну вразливість у лікарняному софті, через яку були відкриті персональні дані. Попередні фронтирні моделі цю вразливість пропустили. На CWE-bench v1 Argon ділить перше місце з результатом 68%.
Безпека
Захист від зловживань у кібер- і CBRN-сценаріях.
Лідерство в стійкості до непрямих prompt injection (бенчмарк Gray Swan IPI).
Моніторинг chain-of-thought: якщо агент виходить за межі наміру користувача, виконання зупиняється.
Ціни
Ввідна ціна: $2 за 1M вхідних і $10 за 1M вихідних токенів, кешований вхід на 95% дешевший. Після ввідного періоду — $4 / $20.
На тлі конкурентів
GPT-6 Astra від OpenAI (3 вересня) коштує $10 / $50, генерує до 128K токенів і на DeepSWE v1.1 має 74,1%, на AutomationBench — 41,4%. Claude Opus 5.5 від Anthropic (22 вересня) коштує $4 / $20, на AutomationBench має 40,0%, а лідирує на Terminal-Bench 4.0, де Google цифр не публікує. За заявленими результатами Argon попереду в довгих інженерних задачах і бізнес-автоматизації, а за довжиною генерації відривається у вісім разів. Після ввідного періоду ціна Argon зрівняється з Opus 5.5.
Головна відмінність у тому, що обидві моделі конкурентів доступні вже зараз, а Argon поки що ні. Усі цифри вендорські, отримані в різних налаштуваннях.
Моя думка така: бенчмарки вказують на те, що саме цю модель ми побачимо як Gemini 4 Pro чи може вони Аргон і залишать.
Сталося, нарешті!
Post #1701
467

- ❤ 8
- 😁 2
- 🤨 1