TGViewer
Бороздин Дмитрий Бороздин Дмитрий @borozdind · 4.06K subscribers
Post #259 1.46K
Кто круче управляет компанией — ИИ или скрипт на 200 строк?

Мы всё спорим, какая модель умнее: кто лучше пишет код, кто быстрее считает, у кого длиннее контекст. Но управление компанией — это не одна задача. Это тысяча связанных решений на длинной дистанции, где последствия приходят с задержкой, а данные вокруг далеко не всегда точны. И вот с этим у ИИ всё сложно.

Наткнулся на свежий бенчмарк CEO-Bench, который проверяет способность моделей вести компанию к цели. Авторы из Princeton University называют это steering intelligence.

Условия: агент управляет SaaS-стартапом 500 дней через программный интерфейс — 34 инструмента, база из 19 таблиц, живой рынок. На старте $1 млн и ноль клиентов. Метрика одна — сколько денег на счёте в конце.

Актуальный результат (лидерборд обновляется, я смотрю на сегодняшний):

Rule-Based Baseline — $15,76 млн
Claude Fable 5
— $12,63 млн
GPT-5.6 Sol
— $11,31 млн
Claude Opus 4.8 — $2,40 млн

Выше стартового миллиона удержались только три модели. Но самое интересное — их обошёл baseline. Простой алгоритм, который фиксирует цены и тарифы, концентрирует привлечение на узкой группе клиентов и подстраивает мощности под реальное потребление. Никакого интеллекта в цикле принятия решений.

По разбору авторов, успех коррелирует с тремя вещами: умением вычитывать скрытую структуру из данных, просчитывать последствия и подстраиваться под давление конкурентов. А сыпется большинство моделей на другом. Они не могут удержать вместе рост, качество и денежный поток на длинной дистанции.

Дисциплинированная стратегия в жёстких рамках обыгрывает свободную импровизацию умной модели.


А я как раз недавно писал пост о harness engineering. Сильная модель без внешнего контура (правил, границ, критериев решения) на коротком горизонте выглядит блестяще, а на дистанции в 500 дней проигрывает скрипту.

👉 Вывод для тех, кто уже сажает ИИ на управленческие задачи: вкладываться стоит не в модель поумнее, а в контур вокруг неё. Правила, память, сверка с данными, понятные критерии выбора.

Для калибровки: теоретический потолок в этой симуляции авторы оценивают в $2,2 млрд. То есть лучший результат — меньше процента от возможного. Бенчмарк далёк от насыщения, и это, пожалуй, главная новость: управлять вдолгую пока из моделей не умеет почти никто.

Кому интересно, репозиторий CEO-Bench и статья.
  • 🔥 13
  • 👍 6
  • ❤ 4
  • 🙏 2
More from @borozdind
  1. Sep 23, 2026Есть М.Видео, а есть Nvidia. У первой почти 60 млрд руб убытка, у второй — 60 млрд долларо…
  2. Sep 16, 2026Я бы включил Git в обязательную программу MBA А вместе с ним — работу с данными, правами д…
  3. Sep 14, 2026Собрал топ-9 постов прошедшего лета, которые стоит прочитать, если пропустили ⚡️ Июнь 1. Р…
  4. Sep 3, 2026М.Видео закрыли больше 40% магазинов за год. Чистый убыток вырос до 36,1 млрд рублей проти…
  5. Aug 31, 2026Data Insight и Яндекс прогнозируют 2–3 трлн рублей продаж через ИИ-агентов к 2032 году Три…
  6. Aug 25, 2026В 108 раз за полгода выросло число юристов, которые каждую неделю работают с Codex по данн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →