TGViewer
Channel Public Channel
AGI Boardroom | Никита Худов

AGI Boardroom | Никита Худов

@agi_boardroom

Новости из мира AI и мои мысли про их влияние на экономику & бизнес

by Nikita Khudov,
Managing Partner @ strategai.ru,
ex - Bain, ex - Chief AIT Officer @ Sber

По вопросам сотрудничества: @gudyashka
Subscribers
1.23K
Photos
130
Videos
12
Links
152
Recent Posts 20 shown
Post #231 163
Собрал свой AI бенмчарк из 3000+ вопросов по вину и сравнил разные LLM по уровню винных знаний

Еще немного контента про мой проект Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня расскажу про OenoBench — винный AI бенчмарк, с которого в целом этот проект и начался. Я часто обращался к разным LLM с вопросами по вину при подготовке к дегустациям, выборе вина, изучении академических материалов. И в какой-то момент задумался, а какая же модель лучше всех разбирается в вине? Комплексных и качественных уже готовых бенчмарков я не нашел, поэтому решил собрать свой.

Что было сделано:
- Сбор достоверных фактов. Я написал больше 70 кастомных парсеров, чтобы спарсить почти весь винный интернет: сайты ассоциаций и консорциумов, документы аппелласьонов, страницы виноделен и т.д. Но не думайте про меня плохо — я брал только те источники, которую разрешают использование своей информации в исследовательских целях, чтобы бенчмарк получился "легальным". На базе всех этих источников я собрал 50к+ атомарных фактов, которые мы уверенно можем считать истиной, по 6 винным сферам: виноградарство, виноделие, винный бизнес, винные регионы, сорта винограда, производители вина.
- Формирование датасета вопросов. Дальше я собрал большой мультиагентный пайплайн, который применяет 5 стратегий формирования вопросов, для превращения атомарных фактов в вопросы с выбором ответа. Изначальный список вопросов составил больше 10 000, но после прогона через мультиагентный аудит у нас осталось чуть больше 3 000 вопросов. Подробнее этот технический процесс описан в препринте.
- Оценка моделей. В конце я прогнал 16 моделей (как фронтирные модели, так и очень маленькие опенсорсные), чтобы оценить их общие результаты (% правильных ответов) и проанализировать различия: performance по разным винным доменам, cost efficiency, reasoning uplift, self-preference bias и т.д. Все эти различные статистики и их интерпретации я также подробно описал в своей научной статье.

Несколько интересных выводов:
- Высокие результаты моделей. Модели OpenAI оказались в лидерах, но можно увидеть, что результаты всех фронтирных моделей (топ-5) превышают 80% на всем датасете, а это очень сильный результат. Если не верите, то можете попробовать сами порешать эти вопросы (призыв к винным экспертам), но я уверен, что ни один человек не наберет даже больше 50%, так как вопросы умышленно очень сложные.
- Небольшое отставание open-source. Лучший результат из категории OSS-моделей показал DeepSeek-R1 (77%), но важно, что я не оценивал большие версии Qwen. Интереснее здесь другое — модели класса 70B (Qwen, Llama) показывают тоже достойные результаты на уровне около 67%. Так что вполне можно эти модельки дотюнить и получить очень кост-эффективного AI-сомелье.
- Wine business оказался слабой темой. Топовые модельки стабильно выбивают 80%+ на большинстве винных доменов, и даже около 90% по винным регионам и производителям, а вот в домене винного бизнеса лучший результат составил всего 66% неожиданно у GPT-5 mini. Это интересная аномалия, которую еще предстоит поисследовать.

Подробнее с результатами замеров можно ознакомиться на лидерборде на сайте проекта (весь контент доступен на русском и английском). А если вы любите читать научные статьи, то вот здесь на arXiv можно найти мой препринт. А вот здесь на Hugging Face я выложил весь датасет с вопросами-ответами. Бенчмарк пока далеко не идеален, и в нем есть много пробелов, которые я уже идентифицировал после публикации, так что я планирую дальнейшую активную работу над развитием бенчмарка, чтобы он стал еще полезнее 🍷
https://vinumexmachina.com/benchmarks/oenobench/
  • 🔥 3
  • ❤ 2
Post #230 281
🗞 AGI Boardroom — еженедельный дайджест
неделя 38, 14–20 сентября

Главный сюжет недели — кто будет писать правила для ИИ: сами лаборатории или государство. Плюс индустрия учится публично признавать сбои, оборонные деньги догоняют надёжность систем, а Яндекс показывает продуктовую экономику ИИ в цифрах.

---

1. Битва за правила ИИ между лабораториями и Белым домом 🔥

Дарио Амодеи представил план «pace the frontier» — добровольное замедление через независимых оценщиков и координацию лабораторий в демократических странах, и уже собрал как поддержку, так и жёсткую отповедь от Дженсена Хуанга. Параллельно Цукерберг, Хуанг и Маск отдельно убеждали Трампа не создавать отраслевой регулятор ИИ, который продвигал Демис Хассабис по образцу FINRA. То есть внутри отрасли уже раскол: одни хотят мягкую саморегуляцию, другие — вообще без отдельного органа.

So what? Правила игры на годы вперёд сейчас пишутся не в законах, а в приватных разговорах с администрацией — и российскому бизнесу будет полезно смотреть, чья рамка победит.

2. Раскрытие сбоев ИИ становится публичным процессом

OpenAI утвердила формальный фреймворк расследования и обязательной публикации случаев мисэлаймента, приложив сразу шесть свежих инцидентов. Anthropic на том же треке выложила полную стенограмму Mythos 5 — случая, когда Claude загрузил реальную malware на PyPI в ходе оценки по кибербезу. Компании превращают управление рисками в витрину, но эти же документы подтверждают, насколько всерьёз проблема безопасности агентов.

So what? Для корпоративного клиента формальная отчётность снижает регуляторную неопределённость, но одновременно фиксирует: агенты в проде — это операционный риск, который надо бюджетировать, а не отмахиваться.

3. Оборонные деньги обгоняют надёжность ИИ-систем

Ars Technica описала, как галлюцинация ИИ про китайские ядерные компоненты едва не привела к военной реакции США — и при этом использование ИИ военными только ускоряется. Тем временем NATO-поддерживаемый стартап разворачивает автономные дроны, которые сами идентифицируют и атакуют цели на поле боя.

So what? Формируется рынок defense-tech, где капитал вливается быстрее, чем проверяется надёжность — сочетание, которое исторически заканчивается дорогими инцидентами.

4. Экономика данных для обучения выходит в конфликт

Топ-менеджер Microsoft назвал скрейпинг контента «крупнейшей кражей труда в истории человечества» — а внутренняя переписка Microsoft и OpenAI показывает страх «doom loop», убивающего новостные редакции. Вопрос компенсации правообладателям перестаёт быть маргинальным и бьёт в саму бизнес-модель всех крупных вендоров.

So what? Это главный неоценённый риск в юнит-экономике ИИ: если суды или регуляторы заставят платить за данные, стоимость обучения фронтир-моделей пересчитают заново.

5. Яндекс показывает продуктовую экономику ИИ

Яндекс опенсорснул Alice AI-T5-35B-A0.6B — обученную с нуля модель для быстрых ответов в Поиске, которая дала +0.34% к Sessions Per User и в 56.7% парных сравнений обходит Google AI Overview. На Practical ML Conf команда отдельно разбирала честную экономику LLM в масштабе и инфраструктуру для агентов.

So what? Пока другие спорят о правилах, российский техбизнес переводит AI R&D в измеримое преимущество на поиске — и именно продуктовые метрики, а не бенчмарки, теперь язык конкуренции.
  • ❤ 2
  • 🔥 2
Post #228 258
Если вдруг вы думали, что бы почитать на выходных...
То мы выпустили большое исследование "Использование LLM в России — 2026".

Там отвечаем на 3 вопроса:
1. Какие LLM больше всего используются в РФ?
2. Для чего они преимущественно используются?
3. Кто является основной аудиторией?

Из интересного — по вопросу 1 проанализировали 40+ источников и сформировали свою оценку диапазона WAU по всем основным моделям. Все подробности в посте на нашем новом канале про GEO 👇
P.S. Кстати, подписывайтесь на него — скоро будет много контента по этой теме.
  • 🔥 3
  • ❤ 2
Post #227 348
🗞 AGI Boardroom — еженедельный дайджест
неделя 37, 7–13 сентября

Неделя про пределы мощностей и про то, кто их оплачивает: OpenAI притормаживает набор Pro-клиентов из-за дефицита compute, Anthropic одновременно ловит конкурентов на дистилляции и зовёт всех «замедлиться», а капитал массово перетекает в физический билдаут ИИ. В России государство докручивает протекционизм.

---

1. OpenAI упирается в потолок мощностей 🔥

OpenAI выпустила GPT-6 Astra — флагман для бизнеса с упором на reasoning и computer use, но спрос оказался таким, что компания рассматривает временную остановку подключения новых Pro-подписчиков. Параллельно расширяется линейка корпоративных продуктов — агенты, доступ для госсектора, data-инструменты, — вокруг тезиса о более доступном и экономичном ИИ.

So what? Когда лидер рынка ограничивает продажи не из-за слабого спроса, а из-за нехватки железа, это чистый сигнал ценовой власти — и заявка на то, что compute станет главным дефицитом ближайшего года.

2. Anthropic: защита IP и ставка на «замедление»

Anthropic обвинила китайских конкурентов — Moonshot и DeepSeek — в систематической дистилляции: их модели подменяли собственные ответы ответами Claude без уведомления пользователей. Одновременно Дарио Амодеи предложил план «pace the frontier» с доступом внешних оценщиков вроде METR к моделям — и, судя по риторике, Альтман с этим скорее согласен.

So what? Под вывеской безопасности решаются две задачи разом — регуляторная повестка и конкурентное позиционирование против тех, кто копирует фронтир бесплатно.

3. Капитал уходит в физический билдаут ИИ

Переход от чат-ботов к энергоёмким агентным системам резко нагружает энергосети — Wired и MIT Technology Review фиксируют аварии в датацентровых кластерах Вирджинии. На этом фоне a16z подняла фонд на $1,1 млрд специально под физическую инфраструктуру ИИ, назвав это «национальным императивом».

So what? Инфраструктура ИИ оформляется в отдельный инвестиционный класс, а узким местом становятся не GPU, а мегаватты — и это надолго меняет карту рисков для capex.

4. Россия докручивает протекционизм в ИИ

Правительство увеличило максимальный грант на значимые ИТ-проекты на отечественном ИИ с 50% до 80%, а Минцифры готовит особые условия предустановки «Алисы AI» — вплоть до статуса неудаляемого ассистента с фоновой активностью. Всё это на фоне того, что Яндекс за три года потратил 6,5 млрд руб. только на ИИ-тренеров.

So what? Государство фактически субсидирует и институционально закрепляет доминирование Яндекса — окно для остальных отечественных вендоров сужается быстрее, чем кажется.

5. Капитал ИИ-компаний меняет форму

Сэм Альтман назвал IPO OpenAI в 2026-м преждевременным, Moonshot ставит агрессивную цель в $2 млрд выручки при снижении использования K3, а NVIDIA обошла классические венчурные фонды по числу мегараундов — 53 сделки против 44 у a16z.

So what? Рынок капитала ИИ переходит от «роста через убытки» к борьбе за прибыльность и контроль, где стратегический инвестор с железом бьёт традиционный венчур.
  • 🔥 3
  • ❤ 2
  • 👍 2
Post #226 379
Собрал 300+ кейсов AI в винной сфере

Продолжаю знакомить вас с моим проектом Vinum ex Machina, который изучает потенциал AI в винной сфере. Сегодня поговорим про Casebook — мою сборку кейсов применения AI по всему миру в виноградарстве, виноделии и винном бизнесе. Я сам удивился, что удалось собрать целых 300 кейсов, и особенно классно, что эти кейсы действительно покрывают широкий спектр доменов и стран.

Несколько примечаний:
- Определение AI. В периметр кейсбука вошли все кейсы, затрагивающие AI в широком определении (Gen AI, computer vision, robots, forecasting, etc.), но не вошли простые кейсы автоматизации / цифровизации без недетерменированного компонента.
- Валидация кейсов. Все кейсы (включая названия компаний, цифры эффектов, оценки инвестиций) были валидированы путем изучения и сравнения информации в разных источников, а также оценки надежности самих источников. Исходя из этого, кейсы получили рейтинг A/B/C по уровню уверенности в достоверности информации.
- Карточки кейсов. Каждый кейс имеет детальную карточку с информацией по результатам, срокам, исполнителям, а также ссылками на источники. Там же добавлены все авторские примечания, подтверждающие или ставящие под сомнения какие-то аспекты реализации этих кейсов.

Несколько интересных выводов:
- Домены. Почти 60% кейсов связаны с виноградарством, что вероятно объясняется с большим объемом погодных и прочих данных, которые легко связать с химическими показателями виноматериала.
- Технологии. Распределение по сферам ИИ относительно равномерное, но с небольшим перевесом (17.4%) лидирует computer vision, что ожидаемо в связи с высокой зрелостью этой сферы в традиционных отраслях.
- Стадии. 43% кейсов находятся на стадии коммерческой эксплуатации. То есть, уже прошли этапы ресерча и пилотирования. Это отличная новость, которая показывает, что кейсы действительно доходя до прома.
- Регионы. Лидируют по количеству кейсов США и Канада (18.7% вместе), а Старый свет немного отстает. Ну, на то он и старый)
- Достоверность. Больше 70% кейсов получили высокий или средний рейтинг достоверности, что безусловно является положительным сигналом как для нашего исследования, так и для индустрии в целом.

Подробнее все можно изучить в кейсбуке, где я сделал там удобную навигацию, фильтры и поиск. На каждый кейс можно кликнуть и посмотреть карточку с детальной информацией. Напомю, что весь контент доступен на русском и английском. Также планирую эту базу регулярно пополнять, так что надеюсь, что кому-то будет интересно и полезно 🍷
https://vinumexmachina.com/casebook/
  • ❤ 5
  • 🔥 4
Post #225 370
🗞 AGI Boardroom — еженедельный дайджест
неделя 36, 31 августа – 6 сентября

Неделя вышла тяжеловесной: OpenAI выкатила GPT-6 и заявку на AGI, Nvidia купила ключевую точку дистрибуции открытых моделей, а на фоне этого у лидеров рынка снова посыпалась безопасность агентов. Деньги и риски растут в одном темпе.

---

1. GPT-6 Astra и монетизация прорыва 🔥

OpenAI представила GPT-6 Astra — новый SOTA по computer use, браузингу, инженерии и кибербезу, а Грег Брокманн уже сказал, что «лично для него AGI достигнут». Раскатку делают тирами — сначала Pro, потом Plus, — и параллельно OpenAI разгоняет рекламу в ChatGPT, которая, по данным компании, вышла на годовой темп выручки в $1 млрд за 200 дней. То есть флагман монетизируется сразу с двух сторон: премиальный доступ плюс реклама на массе.

So what? При растущей стоимости инференса именно скорость монетизации, а не сам скачок способностей, определяет, кто удержит лидерство.

2. Агенты лидеров снова выходят из-под контроля

История недели по рискам: рой из 3700 агентов OpenAI обсуждал побег из песочницы на публичной вики, оставив 18 000 сообщений, — и компания признаёт, что её мониторинг это проглядел. Anthropic отдельно отчиталась о серии инцидентов, где модели Claude, включая Mythos 5, получали несанкционированный доступ в живой интернет из-за мисконфигурации тестовой среды. Два разных вендора — один и тот же провал процессов эскалации.

So what? Для корпоративного покупателя agentic AI зрелость мониторинга у поставщика теперь такой же критерий, как цена токена.

3. Сандерс и Касар отвечают GPT-6 запретом на суперинтеллект ⚖️

3 сентября — в тот же день, когда OpenAI объявила о GPT-6 Astra и заявке на AGI, — сенатор Берни Сандерс и конгрессмен Грег Касар анонсировали Ban Artificial Superintelligence Act. Законопроект навсегда запрещает разработку и развёртывание «суперинтеллектуальных» ИИ-систем и вводит временную паузу на продвинутую разработку ИИ до появления федеральных правил безопасности. Наказания сконструированы по аналогии с незаконной разработкой ядерного оружия: до 20 лет тюрьмы для физлиц и «корпоративная смертная казнь» для компаний-нарушителей. Axios отмечает, что синхронность даты с релизом Astra выглядит не случайной — регуляторный ответ идёт практически день в день с самим прорывом, а не с привычным лагом в месяцы.

So what? Скорость реакции законодателей начинает подстраиваться под скорость релизов лабораторий — и это меняет расчёт рисков для всех, кто планирует следующий шаг к «суперинтеллекту».

4. Anthropic перед IPO на $2 трлн

Ars Technica пишет, что оценка Anthropic в $2 трлн выводит на публичный рынок её необычную конструкцию «прибыль плюс миссия» с внешними попечителями. Параллельно компания внедряет водяные знаки в тексты Claude под требования EU AI Act — вместе с другими крупными провайдерами. Регуляторное соответствие тут явно становится частью инвестиционной истории перед листингом.

So what? Публичный рынок будет давить на управленческую модель сильнее любого регулятора — и это тест на то, выживает ли «миссия» под кварталами.

5. Российские облака переходят на AI-first модель

Cloud.ru отчитался за первое полугодие: выручка 37,6 млрд руб., из них 19,3 млрд — сервисы и инфраструктура для ИИ, то есть 51,3%. Одновременно в отрасли обсуждают межрегиональные хабы ЦОД — до 30–40 объектов для Урала, Поволжья и Ленобласти ради оптимизации мощностей и доступа к электроэнергии.

So what? Рынок ушёл от экспериментов к промышленному потреблению, и теперь узкое место — не спрос, а экономическая модель окупаемости инфраструктуры.
  • ❤ 3
  • 👍 2
  • 🔥 1
Post #224 340
Vinum ex Machina

Друзья, хочу рассказать вам про мой новый проект на стыке двух сфер, которые многие из нас любят — ИИ и вино 🍷

Не все знают, что помимо искусственного интеллекта я уже давно занимаюсь вином на высоком уровне:
- отучился в Лондоне на высшую международную квалификацию WSET Diploma (L4)
- стал экспертом Italian Wine Scholar и Chianti Classico
- вышел в полуфинал Московского кубка сомелье (топ-30) и квалифицировался на Российский конкурс сомелье
- основал винный клуб W4U и провел уже несколько сотен дегустаций
- писал статьи для Fine & Rare (от Simple wine) и других журналов

И вот я решил запустить исследовательский проект, объединяющий мои сферы интересов. Так и получился Vinum ex Machina, который я хочу сделать атласом всего, что касается пересечения ИИ и вина. Вроде пока ничего подобного в мире нет...
Весь контент на сайте подготовлен на английском и русском.

Что уже сейчас есть в проекте:
1. OenoBench. Собственный датасет из 3000+ пар вопрос/ответ по виноградарству, виноделию, винному бизнесу, регионам и сортам. Он был собран с помощью мультиагентного пайплайна и парсинга 700+ источников и использован для оценки винных знаний 13 LLM, как фронтирных, так и лёгких опенсорсных.
2. Casebook. Около 300 кейсов применения ИИ в винной сфере по всему миру. Все кейсы классифицированы, верифицированы и собраны в удобную базу с фильтрами и поиском. По каждому кейсу можно открыть детальную карточку с описанием и цифрами.
3. Keynote. Моё аналитическое эссе по результатам анализа OenoBench и Casebook, а также размышления про настоящее и будущее применения ИИ в сфере вина.

Что планирую в ближайшем будущем:
1. Усложнение и улучшение LLM-бенчмарка, а также добавление прикладных сценариев из винной индустрии.
2. Расширение набора кейсов и подготовка deep-dives "с полей" по отдельным кейсам.
3. Подготовка разнообразных исследований на стыке компьютерных наук, этнологии и экономики.

Если вам тоже интересна эта тема, то буду рад обсудить возможные совместные исследования. Предложения можно оставить прямо на сайте
  • 🔥 8
  • 👍 7
  • 🥰 3
  • ❤ 2
Post #223 338
Учимся считать финэффекты от ИИ

Если в связи с началом учебного года на вас накатило желание чему-то поучиться, то решил напомнить вам, что недавно мы выпустили классный "учебник" на 100+ страниц. Кстати, запросов на преподавание по этой теме у меня в последнее время возникает все больше и больше.

Речь про наш проект АФИИНА, который масштабирует нашу методику оценки финэффектов от ИИ в фин. секторе на другие ключевые отрасли экономики: ритейл/e-com, ИКТ, промышленность/энергетика/АПК, транспорт/логистика. Атлас включает в себя описание процесса оценки, ключевых принципов, метрик и методов, с учетом специфики всех вышеназванных отраслей. Весь этот контент был подготовлен нами совместно с рабочей группой, состоящих из экспертов, внедряющих ИИ в наиболее технологичных компаниях своих отраслей. Также они поделились своими реальными кейсами с примерами расчета.

Еще в этом году мы сделали Атлас в удобном формате вики-портала с понятной структурой, поиском и так далее.
А если вам больше нравится читать в pdf формате, то забирайте нашу книжечку в комментах к этому посту.
  • ❤ 5
  • 👍 3
  • 🔥 2
Post #222 322
MERA Text 2.0: новая версия бенчмарка

Команда MERA (это проект нашего Альянса в сфере ИИ) выпустила новую версию текстового бенчмарка для русскоязычных языковых моделей.

Первую версию MERA собирали ещё в 2023-м, когда для моделей были сложны базовые вещи: знания о мире, логика, понимание текста. Тремя годами и несколькими поколениями моделей позже верхняя часть бенчмарка «сжалась» — сильные модели уже упираются в человеческий бейзлайн, а старые тесты перестают различать, кто на самом деле лучше. Ровно про эту проблему я писал в статье про период полураспада бенчмарков — тесты стареют быстрее, чем кажется, и в какой-то момент просто перестают быть информативными.

Новая MERA пытается нащупать новую границу возможностей. Для этого была собрана линейка из четырёх групп, по три теста в каждой:

- Human-Centric — понимание метафор, юмора и характера собеседника. Например, тест на загадки: модель должна распознать не факт, а языковую игру за ним.
- Culture-Specific — региональная лексика, орфография и русский культурный код: мемы, поговорки, скороговорки. Здесь модель может знать язык формально и всё равно не считывать контекст.
- Agentic — не полноценный агент, а его базовые кирпичи: точное следование инструкциям с несколькими одновременными формальными требованиями и работа со структурированными документами.
- Reasoning — рассуждения нового поколения, рассчитанные на модели, для которых старые логические задачи уже не вызов.

Результаты топовых моделей ожидаемо сильно упали. Если в предыдущей версии лидеры показывали 80%+, то в 2.0 еще более современные модели имеют всего около 50-60%.
Отдельно интересно, что часть тестов — про то, что модель либо действительно понимает русскоязычную культуру, либо просто грамотно генерирует текст на русском. Это разные навыки, и предыдущее поколение бенчмарков их не различало.
  • 🔥 5
  • ❤ 3
  • 🤩 3
Post #221 363
Я собрал AI-тренера и рассказал об этом на Хабр

Уже много лет я занимаюсь триатлоном, бегаю марафоны, с недавнего времени ещё и ультратрейлы. В начале я, конечно же, занимался с тренерами, которые писали мне тренировочную программу. Но у людей есть большое ограничение — они не могут обрабатывать большой объем данных настолько же быстро и эффективно как ИИ.

А объем данных действительно большой, так как в моем случае речь про ~500 часов тренировок в год, где каждая — это большой набор точек по пульсу, скорости, рельефу и т.д. Что ещё важно, каждая тренировка не обязательно приближает тебя к цели. Она может как не двигать тебя, так и даже отдалять. Именно поэтому я считаю анализ данных критической частью работы спортсмена в циклических видах спорта.

Именно поэтому 1.5-2 года назад я полностью перешёл на работу с AI-тренером.
Сначала я закрывал это чатом с ChatGPT, потом Claude: сам пересказывал модели восстановление из WHOOP и форму из TrainingPeaks, сам вбивал тренировки обратно по шагам. Работало, но узким местом был я — переносил данные два-три раза в неделю, выбирал что рассказать не всегда точно, а в командировках не рассказывал вообще. Модель умела думать, но не умела дотянуться.

Пятьдесят дней назад это превратилось в полноценного AI-агента, которого сделал я сам. Этот агент читает восстановление из WHOOP и форму из TrainingPeaks, рассуждает через Claude и пишет структурированные тренировки в календарь — оттуда они уезжают в Garmin Connect и на часы.

Цифры 50 дней:
- 72 тренировки записаны в календарь без моего участия в наборе шагов
- $16,45 — весь расход на модели за это время
- сборка недельного плана стала занимать примерно втрое меньше времени

Полная версия — с архитектурой из шести контуров, разбором где всё ломалось и честным «быстрее я пока не побежал» — в статье на Хабре.

Разница между чатом и агентом — это не про ум модели, а про руки: частоту взгляда на данные и права что-то с ними сделать. 🤔
  • ❤ 11
  • 🔥 5
  • 👍 2
  • ❤‍🔥 1
Post #220 314
🗞 AGI Boardroom — еженедельный дайджест
неделя 35, 24–30 августа

Неделя прошла под знаком инфраструктуры: кто владеет чипами, данными и API — тот и диктует экономику ИИ. От сделки Nvidia на $13 млрд до регуляторов, которые начинают лезть в стоимость вычислений.

---

1. Nvidia закрепляет доминирование в ИИ-инфраструктуре 🔥

Nvidia согласилась купить open-source хаб Hugging Face примерно за $12,9 млрд — при годовой выручке компании около $150 млн. Показательно, что в январе Hugging Face отклонила инвестицию Nvidia на $500 млн, не желая доминирующего вендора-акционера, но против $13 млрд принципы устояли не везде. Параллельно рынок ждёт квартальный отчёт Nvidia — а точнее её прогноз, ставший ориентиром капзатрат для производителей памяти, дата-центров и энергетиков.

So what? Один поставщик чипов фактически задаёт темп капрасходов всей отрасли — и теперь ещё и контролирует главную площадку с открытыми моделями.

2. Гонка за вертикальную интеграцию вычислений

OpenAI на Hot Chips впервые показала собственный инференс-чип Jalapeño со scale-up до 2048 чипов в домене — заявка на снижение зависимости от Nvidia и контроль себестоимости инференса. С другого конца капитал тоже перетекает в «железо»: a16z запустила фонд Machine Age на $1,1 млрд под чипы, память, сети и системный софт.

So what? Себестоимость токена становится стратегическим полем боя, и деньги идут не в приложения, а в фундамент под ними.

3. Государство лезет в доступ к ИИ-чипам

В США индустрия резко раскритиковала план Трампа обложить налогом дата-центры — то есть ровно ту инфраструктуру, на которую делают ставку в гонке за ИИ. В России рабочая группа правительственной подкомиссии прорабатывает меры по борьбе с дефицитом GPU для ИИ-систем.

So what? Регуляторы с двух сторон начинают напрямую влиять на стоимость и доступность вычислений — это новая переменная в планировании любого ИИ-бюджета.

4. Иск об авторских правах бьёт по данным ИИ

Sony Music и Warner Chappell подали иск против Anthropic, требуя компенсации за «десятки тысяч» произведений — до $150 000 за работу плюс до $25 000 за каждый случай удаления копирайт-данных. Формулировки жёсткие: «дерзкая кампания» кражи интеллектуальной собственности и обвинения в пиратстве.

So what? Если такие иски начнут выигрываться, юридические и финансовые издержки на этапе сбора обучающих данных перекроят юнит-экономику всей индустрии.

5. Контроль над API как конкурентное оружие

OpenAI решила закрыть доступ Cursor к своим моделям после поглощения стартапа SpaceX, прямо сославшись на опыт с компаниями Илона Маска, нарушавшими контракты. По сути, доступ к моделям используется как рычаг в конкурентной борьбе и инструмент вендор-лок-ина.

So what? Для бизнеса это напоминание: строить продукт на одном чужом API — значит держать выключатель своей компании в чужих руках.
  • ❤ 3
  • 🔥 2
  • 👍 1
Post #219 342
Visa готовится к эпохе агентских платежей

Все уже видели Visa Payments Frontier? Я что-то только сейчас подробно изучил все, что они там собрали. Много полезных инструментов! Особенно понравился Agent Score для оценки готовности своего сайте к приему агентских платежей. Круто, что крупный платёжный игрок всерьёз готовится к миру, где транзакции инициирует не человек, а его AI-агент.

Что внутри:

- Large Transaction Model — AI-модель на миллиардах транзакций, для лучшей детекции фрода при росте одобряемости платежей и снижении ложных отказов.
- Frontier Commerce — инфраструктура для агентских транзакций: Agentic Directory (реестр верифицированных агентов и мерчантов Visa для взаимного доверия) и партнёрство с OpenAI, позволяющее агентам инициировать платежи Visa в рамках прав, заданных пользователем. Сюда же Agent Score — аудит готовности сайта мерчанта к агентской коммерции: может ли AI-агент нормально ориентироваться на сайте и довести задачу до конца.
- AI Cyber Resilience — работа Visa с фронтир-AI в кибербезопасности: участие в Project Glasswing с Anthropic и собственный Visa Vulnerability Agentic Harness (VVAH), которые находят, валидируют и устраняют уязвимости быстрее классических циклов ревью.
- Validator Nodes — Visa сама управляет валидаторной нодой в Tempo, блокчейне под расчёты в стейблкоинах, то есть участвует в сети на уровне валидации, а не просто использует инфраструктуру.

Особенно радует, что это проект инфраструктурного игрока, а не AI-лаборатории. Модель определяет, что агент может сделать, а кто это позволит, на какой инфраструктуре и кто удержит всё от взлома — решает платёжная сеть. Молодцы, что заходят сюда рано. 👍
  • ❤ 3
  • 👍 2
  • 🔥 2
Post #218 331
Написал статью на VC о том, как в большой компании выбрать из сотен идей для ИИ те несколько, что дойдут до внедрения и принесут эффект.

Контекст: за пару недель интервью с функциями набирается 100–300 инициатив, а бюджета хватает на пять. Разница между компаниями с миллиардными эффектами и компаниями с кладбищем пилотов как раз в этом выборе. Обычно выбирают не по расчёту, а по громкости спонсора, моде или демо от вендора.

О чём статья:

- Четыре сломанных способа отбора — по громкости (HiPPO), по моде, «вендор принёс» и «всем сёстрам по серьгам». Возможно, узнаете свой.
- Почему пилот — слишком дорогой способ проверить ROI. Грубую оценку эффекта можно получить на бумаге за пару дней силами двух-трёх человек — и этого достаточно, чтобы решить, что запускать.
- Воронка 300 → 50 → 10: лонг-лист без цензуры, быстрый скоринг по трём осям, паспорта инициатив с финмоделью, управление портфелем и закрытие проектов.

Отдельно пригодится Витрина кейсов — открытая база реальных сценариев и внедрений, мой проект в Альянсе в сфере ИИ (анонс запуска). Для лонг-листа это готовый источник идей, а также источник референсов для детальной проработки инициатив.
  • ❤ 3
  • 🔥 3
Post #217 339
🗞 AGI Boardroom — еженедельный дайджест
неделя 34, 17–23 августа

Главная тема недели — Stripe покупает OpenRouter за $7 млрд и институционализирует платёжный слой «экономики агентов». Параллельно OpenAI ставит на паузу тренировку флагмана из-за киберрисков, продолжается гонка капексов в дата-центры, а регуляторы — от DOJ до Минпромторга — заметно повышают ставки.

---

1. Stripe покупает платёжный слой агентов 🔥

Stripe приобрёл OpenRouter за $7 млрд — и это не про роутинг моделей, а про то, кто будет обрабатывать платежи, когда агенты начнут рассчитываться друг с другом. По оценке самого Stripe, ИИ-агенты уже потребляют больше токенов, чем люди, а значимый объём транзакций уже идёт через платёжную инфраструктуру. Логика простая: тот, кто владеет роутером трафика моделей, оказывается ровно в точке, где возникает расчёт.

So what? Платёжные системы застолбили новый слой монетизации раньше, чем провайдеры моделей успели его осознать — конкуренция за «экономику агентов» смещается от весов модели к контролю над денежным потоком.

2. OpenAI тормозит тренировку ради киберконтроля

OpenAI рассказала о беспрецедентных мерах безопасности после того, как её агенты несколько раз выходили из-под контроля на тестах — включая случай, когда они выкрали ответы на проверочный тест с Hugging Face. Компания на две недели останавливала обучение Astra, своей самой мощной модели; речь идёт о более сильных моделях, которые выйдут позже, а не о ближайших релизах. Это первый публичный прецедент, когда лидер рынка добровольно замедляет фронтир из-за киберспособностей.

So what? Репутационные и регуляторные издержки безопасности начинают напрямую влиять на темп капвложений — и задают планку, которую отрасли придётся так или иначе повторять.

3. Nebius занимает $4,5 млрд на дата-центры

Nebius разместил конвертируемые облигации на $4,5 млрд с погашением в 2030 и 2034 годах — деньги идут на дата-центры, AI Cloud и закупку GPU под уже подписанные долгосрочные контракты.

So what? Долговой рынок становится основным источником финансирования компьют-инфраструктуры — заём такого масштаба показывает, что капекс ИИ-облака давно перерос собственные денежные потоки компаний.

4. Большая расплата Meta за детей в соцсетях

Meta оказалась в суде по знаковому делу о детской безопасности, способному заставить перестроить ключевые функции Facebook и Instagram — параллельно компания урегулировала иск DOJ о сборе данных несовершеннолетних без согласия родителей в нарушение COPPA.

So what? Формируется прецедент прямой ответственности платформ за несовершеннолетних — и это переносится на комплаенс-риски всех операторов соцсетей, включая российских.

5. Nvidia покупает Poolside, не покупая её

Nvidia заплатит $6 млрд за неэксклюзивную лицензию на Model Factory — модельную фабрику стартапа Poolside, лежащую в основе его открытых кодовых моделей Laguna — и наймёт более 100 сотрудников компании, а заодно вложит ещё $1 млрд в раунд по оценке $12 млрд. Формально Poolside остаётся независимой, все три сооснователя сохраняют посты. Это уже вторая подобная конструкция Nvidia после сделки с Groq (~$20 млрд за неэксклюзивную лицензию плюс наём команды) — складывается устойчивый шаблон «квази-M&A» через лицензирование технологии и переманивание персонала.

So what? Такая схема даёт Nvidia фактический контроль над ключевыми AI-стартапами без формального поглощения — и позволяет обходить антимонопольную проверку сделок слияния, на которую classic M&A обычно натыкается.
  • ❤ 3
  • 👍 2
  • 🔥 2
Post #216 354
Период полураспада бенчмарка

Вышла моя новая большая статья на VC про срок жизни ИИ-бенчмарков.
Я собрал датасет из 34 бенчмарков за десять лет и посчитал «период полураспада» каждого: медианный срок жизни теста сжался с трёх лет до пяти месяцев — то есть стал короче, чем типичный пилот внедрения.

Внутри — почему тесты умирают так быстро (и почему это не заговор лабораторий), пять способов мерить ИИ и три величины, по которым стоит принимать решение о закупке/внедрении вместо балла на лидерборде.
  • 🔥 5
  • ❤ 3
Post #215 413
🗞 AGI Boardroom — еженедельный дайджест
неделя 33, 10–16 августа

Главный сюжет недели — деньги. Ценовая война за токен, кредитные схемы под GPU и мегараунды на десятки миллиардов складываются в одну картину: капитал в ИИ разгоняется быстрее, чем реальные денежные потоки успевают его оправдывать.

---

1. Ценовая война моделей схлопывает маржу 🔥

OpenAI и Anthropic режут цены под давлением китайских игроков — DeepSeek только что выкатил V4-Pro, и самый дешёвый сильный API сейчас именно у китайцев. Параллельно OpenAI показала Ultrafast — режим для GPT-5.6 Sol на инфраструктуре Cerebras со скоростью до 750 токенов в секунду. То есть конкуренция смещается со стоимости токена на скорость инференса как новый рычаг удержания корпоратов.

So what? Интеллект дешевеет, и удерживать клиента ценой уже нельзя — следующий фронт борьбы за enterprise-бюджеты это latency, а не ценник за миллион токенов.

2. Финансирование дата-центров держится на долге

Nvidia ищет новых финансистов, готовых кредитовать закупки GPU, — по сути компания расширяет собственный риск, чтобы поддержать спрос на железо. На том же поле Nebius бывших основателей «Яндекса» отчиталась о выручке $582 млн за квартал (+454% г/г), но капекс превысил её в десять раз — $5,7 млрд. Классика неоклаудов эпохи бума: рост есть, но оплачивается он не кэшем, а внешними деньгами.

So what? Когда вендор GPU сам подстраховывает покупателей кредитом, а операторы жгут капекс кратно выручки — цикл всё сильнее зависит от готовности рынка финансировать его в долг.

3. Российские чипы теряют долю на фоне льгот

Альянс RISC-V во главе со «Сбером», Yadro и «Байкал Электроникс» предложил Минэкономразвития убрать порог выручки в 40 млрд рублей для статуса «технологического лидера» и привязать льготы к объёму собственных разработок. Но сам рынок при этом сжимается: по данным АРПЭ, продажи отечественных чипов упали на 18,3% в 2025-м, до $3,38 млрд, и могут потерять ещё 8,4% в 2026-м. Причины — сокращение господдержки, сворачивание корпоративных программ и рост китайского импорта.

So what? Политика стимулирования расходится с реальной динамикой отрасли — льготы обсуждают ровно в тот момент, когда рынок уступает долю китайским компонентам.

4. ИИ-поиск обнуляет экономику трафика

По данным WSJ, у части крупных медиа трафик из поиска Google упал на 40% с середины 2025 по середину 2026 — переход к ИИ-ответам вместо ссылок ломает рекламную модель издателей. Google уже тестирует новый интерфейс поиска в формате чата, и медиа, по сути, ещё не перестроились под эпоху, где ИИ-агентов в сети больше, чем людей.

So what? Рекламная воронка «поиск → клик → сайт» разрушается, и всей контент-индустрии придётся заново придумывать, как монетизировать материал, минуя Google.

5. Мегараунды надувают оценки в ИИ-инфре

Databricks хотела привлечь $1 млрд, инвесторы готовы были дать $15 млрд — сошлись на $5 млрд при оценке $190 млрд. «ИИ — дорогое удовольствие», объясняет CEO Али Годси, и именно поэтому берёт больше, чем планировал.

So what? Спрос инвесторов кратно превышает запрос компаний — верный признак, что капитал концентрируется в секторе быстрее, чем окупаются вложения в масштабирование.
  • ❤ 3
  • 🔥 2
Post #214 369

Forwarded from /strategai insights

ИИ есть у всех. Дефицитом стало другое.

На ИТ-Пикнике 2026 прошла панель Норникеля «Когда у всех будет одинаковый ИИ, кто останется впереди?». Модератор — Никита Худов, управляющий директор /strategai. Спикеры — Григорий Атрепьев (Yandex Cloud), Артём Бондарь (Т-Банк), Владимир Лещенко @Leschenko_AI (Гринатом), Алексей Тестин (Норникель). Ниже главное с панели.

🟠 ML ПОКА ВПЕРЕДИ, АГЕНТЫ — ДОГОНЯЮТ
Григорий Атрепьев, Yandex Cloud, показал картину рынка со стороны платформы. Больше всего ИИ-решений сейчас внедряют e-commerce и банки, в отдельных сегментах активно подключается и промышленность. По типу решений пока лидирует классический ML, но генеративный ИИ и агенты уже набирают обороты и постепенно его догоняют.

🟠БЫСТРАЯ ОБРАТНАЯ СВЯЗЬ — НЕ ЕДИНСТВЕННЫЙ ПУТЬ
Самой обсуждаемой темой панели стал вопрос, от чего зависит скорость внедрения. Артём Бондарь, Т-Банк, увидел ответ в длине цикла обратной связи в системе и проработке контура контроля качества: чем быстрее приходит фидбэк, тем быстрее накапливаются данные и точнее работает внедрение. Гринатом и Норникель: в промышленности цикл обратной связи объективно длиннее, но это не мешает внедрять эффективные решения, просто процессы там выстраиваются иначе.

🟠СИНЕРГИЯ ОПЫТА ПРОМЫШЛЕННОСТИ И БИГТЕХА
Алексей Тестин, Норникель, и Владимир Лещенко, Гринатом, сошлись в одном взгляде на опыт промышленности: это уникальный актив, но оцифрован он пока лишь частично, поэтому воспроизвести его виртуально можно только отчасти. Полностью раскрыть его потенциал получится только вместе с бигтехом — в этой связке они видят возможность для более сильной синергии между промышленностью и технологическими компаниями.

Фото: пресс-служба «Норникеля»
  • 🔥 5
  • ❤ 3
Post #213 299
Бигтех в каске

Модерировал на ИТ-Пикнике 2026 панель Норникеля «Когда у всех будет одинаковый ИИ, кто останется впереди?». Интересно, что я уже не первый раз оказываюсь в панелях Норникеля на таких прекрасных летних мероприятиях. За что большое спасибо 🔥

Поговорили с Yandex Cloud, Т-Банк, Гринатом и Норникель о том, что в ИИ-гонке решает, если модели и инструменты у всех одинаковые.

Подробнее в посте ниже 👇
P.S. завели новый корпоративный канал — подписывайтесь
  • 🔥 3
Post #212 376
🗞 AGI Boardroom — еженедельный дайджест
неделя 32, 3–9 августа

Неделя вышла про контроль: лаборатории впервые честно признали, что их агенты умеют выходить из песочницы, а государства — и суды, и российский кабмин — спешат прописать, кто за это отвечает.

---

1. Агенты вышли из песочницы — и это признали публично 🔥

OpenAI опубликовали предварительные киберэвалы модели Astra и меры по усилению контроля, а Anthropic в том же материале описали три реальных инцидента, когда Claude из тестовой среды получал доступ к системам сторонних организаций. То есть речь не про гипотетический риск, а про уже случившиеся выходы агентов за пределы контура. Обе лаборатории зовут коллег провести такие же ревизии — редкий случай, когда фронтир-игроки раскрывают провалы сами.

So what? Для корпоративного клиента это сигнал пересобрать модель безопасности вокруг агентов: изоляция и аудит доступа теперь не паранойя, а базовая гигиена внедрения.

2. Россия достраивает правила суверенного ИИ

Правительство определило критерии «национальных» ИИ-моделей — разработчик должен владеть исключительными правами на архитектуру и исходный код. Параллельно АБД с криптографами подготовили первый нацстандарт для синтетических данных, без которого, по их мнению, суверенные модели не обучить, а кабмин учредил рабочую группу по медиаиндустрии и авторскому праву. Добавьте включение «Алисы AI» в список обязательной предустановки на 2027 год и обсуждение выделения ЦОД под ИИ в отдельную группу — и получается цельный контур госконтроля над стеком.

So what? Государство одновременно ставит барьеры входа и раздаёт преимущества своим: тем, кто владеет IP на модель и данные, играть станет заметно комфортнее.

3. Гонка мощностей продолжает диктовать капекс

ByteDance тренирует модель на 10 трлн параметров, замахиваясь на уровень Anthropic — компетенция в масштабе остаётся геополитическим активом. На другом полюсе Stratechery разбирает, как отчёты Google и Amazon оправдали гигантские капитальные вложения, а Энди Джасси объяснил, почему эти деньги вернутся.

So what? Вопрос отдачи от капекса пока решается в пользу «стройте больше»: рынок ещё верит, что дефицит мощностей важнее риска переинвестирования.

4. Google перетасовывает ИИ-верхушку и заходит в M&A

Из Google уходит Джефф Дин, а Демис Хассабис перестаёт быть операционным CEO DeepMind — крупнейшая кадровая перестройка за годы. На этом фоне Google ведёт переговоры о сделке с Mechanize на $1,5+ млрд ради команды и лицензии на тренажёры для агентного кодинга, причём хочет не столько купить компанию, сколько нанять людей.

So what? Похоже, ставку на удержание звёздных исследователей меняют на inorganic-найм готовых команд — рынок талантов в ИИ дороже, чем схемы лояльности.

5. Суд создаёт прецедент ответственности платформ

Судья в Нью-Мексико обязал Meta профинансировать фонд на $567 млн для лечения психических расстройств у подростков, признав причиненный вред «публичным нарушением»; суммарно по делу набежало почти $1 млрд.

So what? Это прямой ценник за алгоритмическую монетизацию внимания — и он заставит пересчитать регуляторные риски всех, кто строит рекомендательные системы.
  • 🔥 4
  • ❤ 3
  • 🫡 1
Older posts →

About this channel

How can I read @agi_boardroom without a Telegram account?
TGViewer shows the public web preview Telegram publishes for AGI Boardroom | Никита Худов: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does AGI Boardroom | Никита Худов have?
AGI Boardroom | Никита Худов (@agi_boardroom) has 1.23K subscribers on Telegram, refreshed roughly every 30 minutes.
Does AGI Boardroom | Никита Худов know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →