Grok 4.5 — мое почтение
xAI Илона Маска выкатили Grok 4.5.
И это, кажется, первая модель от них, которую я не просто «погонял», а реально начал использовать в боевых агентских задачах.
Что важно:
• модель обучали вместе с Cursor
• в обучении использовали триллионы токенов Cursor Data
• контекстное окно — 500K (скоро будет 1M)
• работает быстрее, чем Codex Spark
• по моим ощущениям, сильнее GLM 5.2 на больших инженерных задачах
• в Grok Build она сейчас используется по умолчанию
• пока есть семидневный trial — можно нормально попробовать
Но самое интересное для меня — даже не сама модель.
А Grok Build.
Это первый терминальный агент, который при первом запуске просто увидел всю мою рабочую среду.
Все мои скиллы.
Все MCP.
Все настройки и интеграции других агентов.
Он сам их нашел, импортировал и сразу начал использовать.
Ты буквально ничего не настраиваешь. Запускаешь Grok Build — и сразу оказываешься в своей привычной агентской среде.
Такого онбординга пользователя я пока не видел вообще нигде.
Обычно новый агент — это очередная настройка MCP, перенос скиллов, конфигов и правил. Потом выясняется, что половина не подцепилась, пути отличаются, а агент живет в пустой комнате и ничего не знает о твоем сетапе.
Здесь — один клик, и все работает.
Для меня это, наверное, самая крутая часть самого Grok Build. Даже круче, чем отдельные возможности модели.
Второе место по качеству такого опыта я бы отдал Z Code 3. Он тоже хорошо подхватывает существующее окружение.
Но первый старт Grok Build — пока самый бесшовный из всего, что я видел.
Дальше я решил проверить модель на реальных длинных задачах.
Все эти задачи я запускал при помощи своего фреймворка Xpowers. То есть модели получали одинаковый агентский harness, планирование, контекст и инструменты.
Одну и ту же крупную задачу я параллельно дал Kimi, GLM 5.2 и Grok 4.5.
И нормально решил ее только Grok 4.5.
Не «почти решил».
Не «нагенерировал много уверенного мусора».
Не «сделал 70%, а дальше пришлось заканчивать руками».
Он просто взял большую задачу, протащил ее через длинный агентский цикл и довел до рабочего состояния.
По моим ощущениям, это сейчас один из самых сильных вариантов именно для agentic coding.
Понятно, что по бенчмаркам уже начинается привычная война: почти Opus 4.7, быстрее Opus, дешевле Opus.
Но мне важнее практический критерий:
может ли модель внутри нормального агентского harness взять большую инженерную задачу и действительно ее закрыть?
В моем тесте — да.
И сделала она это очень быстро.
Потому что качество без скорости в agentic coding — это боль. А скорость без качества — просто быстрый нейрослоп.
У Grok 4.5 пока очень хороший баланс скорости и качества.
И еще один прекрасный продуктовый штрих.
Они сразу зарезервировали себе название Agent.
Терминальный агент можно запускать командой grok, а можно просто:
agent
То есть ребята сразу всем объяснили, кто они и какое место собираются занять на этом рынке.
Короче, если вы работаете с coding agents и гоняете действительно большие задачи, обязательно попробуйте связку Grok 4.5 + Grok Build.
Особенно интересно посмотреть, как она поедет внутри вашего собственного harness.
Мое почтение.
Post #557
458
- ❤ 3
- 👍 3
- 🔥 1