Пока мы обсуждаем, можно ли доверить AI написание текстов, Маск запустил модель, которая самостоятельно управляет бизнесом почти год.
🙀Что произошло
xAI выпустила Grok 4 и протестировала его на Vending-Bench — это не очередной synthetic benchmark про решение задачек. Это симуляция реального бизнеса: вендинговый автомат, который нужно вести месяцами.
Результаты ломают шаблоны:
- Grok 4 проработал 324 дня без критических фейлов
- Прибыль: $4694 (на 31% больше GPT-5)
- Продано товаров: 4569 vs 2471 у GPT-5
- Только 3 модели вообще смогли обогнать человека ($844 за 5 часов работы)
Самое дикое: xAI поставила реальный вендинг с Grok в своём офисе. AI сам решает ценообразование, заказывает товар, управляет кэшфлоу. Команда каждый день проверяет, не закажет ли он 500 пачек орехов или не забудет ли про $2 на аренду.
☺️ Почему это прорыв для продактов
1. Это не тест знаний — это тест выносливости
Большинство AI-моделей отлично решают разовые задачи. Но когда дело доходит до длительных бизнес-процессов — они сыпятся.
Конкуренты Grok не прошли "барьер 120 дней" — начинались циклы деградации, нелогичные решения, краши. Grok держался почти год.
Для нас это значит: AI наконец-то может не просто помогать, а брать на себя целые процессы без постоянного надзора.
2. Экономическая интуиция важнее IQ
Vending-Bench тестирует не "ответь правильно на вопрос", а "заработай прибыль".
AI должен:
- Балансировать revenue и costs
-Динамически менять цены
- Оценивать риски
-Отключать неэффективных поставщиков
- Управлять инвентарём
Это ровно то, что мы делаем в продуктах каждый день. Только теперь AI может делать это автономно и стабильно.
3. От чат-ботов к бизнес-операторам
Мы привыкли использовать AI как ассистента: "помоги написать", "проанализируй данные", "сгенерируй идеи".
Grok 4 показывает другой уровень: AI как самостоятельный оператор бизнес-процессов. Не помощник PM, а PM.
Это открывает путь к:
- Автоматизации supply chain
- Управлению ценообразованием в реальном времени
- Автономной оптимизации операций
- Интеграции с физическими системами (робототехника, производство)
4. Новый стандарт для оценки AI
Забудьте про "модель получила 95% на MMLU". Это vanity metrics.
Новый вопрос: "Сможет ли твоя модель управлять реальным бизнесом 6 месяцев без фейла?"
Если нет — это просто умный калькулятор для разовых задач.
🙋♂️Что это меняет в работе продакта?
- Переосмысление делегирования
Раньше: "AI может помочь с анализом"
Теперь: "AI может взять весь процесс на себя"
- Фокус на долгосрочную стабильность
Не "насколько умна модель", а "насколько она надёжна в длинной дистанции"
- Готовность к автономным агентам
Продукты будущего — это не интерфейсы для людей, а платформы для AI-агентов, которые работают 24/7 без деградации
- Новый подход к рискам
Если AI управляет реальными процессами, нужны новые системы контроля, мониторинга и fail-safe механизмов
Итого:
Если твой продукт завязан на операционных процессах (supply chain, pricing, inventory, logistics) — пора тестировать AI не на разовых задачах, а на симуляциях длительных операций.
Вопрос уже не "может ли AI это сделать", а "сколько времени он продержится без фейла".
Будущее — за AI, который работает месяцами без присмотра, а не за тем, кто круто отвечает на вопросы в чате.
🔥 Маск снова показал: пока все оптимизируют chatbot UI, он строит AI, который управляет реальным бизнесом.
Если хотите почитать подробнее тут вот описание кейса --> смотреть
🩵 - Если было полезно!