Gemini 4 Ленивый
Google вчера анонсировала новую модель – Gemini 4 Argon, которая продолжит замершую на семь с лишним месяцев ветку Pro. По замерам самой Google модель выглядит впечатляюще: в большинстве бенчмарков обходит GPT-6 Astra и Claude Opus 5.5, плюс впечатляет 1М выходных токенов (не путаем с контекстным окном, эта характеристика намного круче – модель одним ответом может напечатать “Войну и мир” целиком).
Промо-цена будет $2/$10 (вход и выход), затем вырастет в два раза, что тоже конкурентоспособно. Доступ сначала получат проверенные киберзащитники, параллельно модель смотрит правительство США. Если все ок, то следом Argon начнут раскатывать на пользователей Google AI Ultra (от $100), ну а после на обычных смертных.
Мощный анонс, но…
Аргон – инертный одноатомный газ, название которого происходит от греческого слова “ленивый”, “бездеятельный”. И как бы у нас не вышла история “как вы яхту назовете, так она и поплывет”.
Bloomberg со ссылкой на нескольких сотрудников Google сообщает, что внутренние тесты модели идут не так гладко, как все смотрится на картинках. Из претензий: неровный кодинг, слабый фронтенд, а также то, что модель большая и поэтому дорогая в работе. Двое источников считают, что модель задел бенчмаксинг: ее затачивали под популярные замеры, а не под работу. Но тот же Bloomberg добавляет – внутри компании есть и сотрудники, кому модель понравилась.
Но у критических утверждений есть предыстория. Когда-то Gemini 3 Pro тоже внушительно выглядела в бенчмарках, но в реальной работе оказалась близка к провалу. Gemini 3.1 Pro ситуацию не спасла, а выпуск Gemini 3.5 Pro и вовсе отменили. Параллельно из Google DeepMind за последнее время ушли Джефф Дин, нобелевский лауреат Джон Джампер и Ноам Шазир, соавтор трансформера.
В день анонса вышли и первые независимые замеры – так что слова анонимов можно проверить по пунктам.
Неровный кодинг – похоже на правду. В работе через терминал Argon уступает сразу трем конкурентам: свежим Claude и GPT-6 Astra.
Слабый фронтенд – тут самое интересное. Когда готовое приложение проверяет робот (кнопки нажимаются, страницы открываются), Argon впереди: 30 безупречных приложений из 50, больше, чем у кого-либо. Когда же на результат смотрят живые люди и голосуют за то, что им больше нравится, он только восьмой.
Дорогая модель – наполовину. По прайсу Argon после окончания скидки будет в 2,5 раза дешевле Astra. Но платим мы не за токен, а за задачу – и тут вся экономия испаряется. Модель очень большая и тратит токены на работу от души, поэтому по независимому замеру обходится даже дороже, чем на Astra.
Бенчмаксинг – цифры точно не рисовали: там, где независимые замеры можно сравнить с гугловскими, они почти совпали. А вот натаскивали ли модель на тесты в ущерб работе, замерами не докажешь, увидим после релиза.
Я пишу этот пост вовсе без злорадства – наоборот, чем больше мощных моделей, тем лучше. У Google Gemini есть и свои сильные стороны: мне нравится, как она пишет на русском языке, я до сих пор считаю эту модель лучшим рассказчиком – она умеет хорошо объяснять сложные темы и держать интерес пользователя. И Argon есть чем гордиться: он первый в независимом рейтинге, где модели решают задачи финансистов, юристов и программистов, а выдумывает втрое реже Astra.
Однако Google отстает не только в моделях – как агентская среда Antigravity уступает Codex и Claude Code, а другие продукты компании, в том числе представленные на I/O в этом мае, так и не набрали популярности.
Так что если Argon даже не окажется лентяем, впереди все равно будет трудный путь к успеху.
—
Опытом работы с ИИ я делюсь в подписке. Там 30+ лонгридов про промптинг, использование ИИ-агентов, а также с обзорами техник ведущих экспертов – от Роберта Мартина до Бориса Черни.
— Подписаться на “Бусти”
— Подписаться на Sponsr
Post #742
3.61K

- ❤ 27
- 🔥 16
- 👍 11
- 👏 3
- 😁 1