При обсуждении акций, связанных с AI-инфраструктурой, мы часто воспринимаем инвестиционную историю дата-центров как единый объект. Однако это не совсем верно. На самом деле ЦОД и его компоненты - это набор совершенно разных рынков с разной экономикой, темпами роста и конкурентной средой.
С учетом того, что большинство интересных кейсов связаны с убыточными небольшими игроками с внушительным потенциалом роста, мне кажется необходимым разобраться, как устроены ЦОДы и где прячется реальный bottleneck.
💰 Куда идет CAPEX?
Интуитивный ответ, конечно же, на строительство здания и инженерную инфраструктуру. На практике же все выглядит несколько иначе.
Основная часть капитальных затрат сосредоточена в ИТ-оборудовании (70%), прежде всего в вычислительных серверах. Инженерная инфраструктура (электропитание, охлаждение, сети, строительство) формирует оставшуюся часть бюджета.
🖥️ Вычислительные серверы - самый дорогой компонент ЦОДа
На них приходится 53-56% от стоимости ЦОДа. Если мы говорим про классические серверные нагрузки, то стоимость сервера в среднем составляет $20 тыс., а для продвинутых LLM (inference + training) сумма доходит до $103 тыс.
Серверы обычно размещают внутри стойки, типичная высота которой - 187 см. При этом для нормального функционирования серверов также необходимы системы хранения данных, коммутаторы, узлы питания и охлаждения. В итоге для самих серверов остается меньше половины всей высоты стойки.
Что делает сервер таким дорогим?
Для ИИ-нагрузок есть два типа серверов: базовый inference-сервер (NVIDIA H100 - модель просто отвечает на запросы) и продвинутый (NVIDIA GB200 NVL72 - на нем модель еще и обучают, что требует намного больше вычислений).
В обоих случаях почти половина стоимости сервера - это GPU вместе с HBM-памятью: около 50% стоимости H100 и 43% стоимости GB200.
GPU - это специализированный вычислительный процессор, который может одновременно выполнять огромное количество однотипных математических операций.
Такие операции лежат в основе работы современных AI-моделей, поэтому в AI-серверах обычно используется сразу несколько GPU, установленных на нескольких платах.
И здесь возникает первый bottleneck: рынок GPU/AI-ускорителей крайне концентрирован.
NVIDIA занимает около 83% рынка, тогда как на AMD приходится 3%, Broadcom - 8%, Marvell - 1%, остальные игроки - около 5%.
🧠 HBM: память, без которой GPU не может работать на полной скорости
Но одного мощного GPU недостаточно. Во время AI-вычислений данные должны постоянно поступать к вычислительному чипу. Если память не успевает их передавать, вычислительная мощность GPU фактически простаивает. Именно поэтому в современных AI-системах используется HBM - высокопропускная память, расположенная буквально в нескольких миллиметрах от вычислительного чипа.
Расстояние здесь имеет значение: чем длиннее проводник, тем выше задержка и тем сложнее передавать сигнал на высокой частоте. Поэтому HBM соединяется с GPU очень широкой шиной. Это позволяет значительно увеличить скорость обмена данными между памятью и вычислителем, но за это приходится платить.
HBM стоит примерно в 5-7 раз дороже обычной памяти DRAM за гигабайт, а ее объем на одном GPU ограничен примерно 80-192 ГБ, против терабайтов обычной оперативной памяти на сервере.
Поэтому HBM становится отдельным критически важным компонентом AI-инфраструктуры. И рынок здесь тоже очень концентрирован: около 60% рынка HBM занимает SK Hynix, еще 21% - Samsung и 19% - Micron.
___
В итоге уже на уровне сервера мы видим двух явных лидеров. И ни для кого не секрет, что это наиболее понятный способ получить экспозицию на рост AI.
Но если искать менее очевидные инвестиционные истории, стоит двигаться дальше по цепочке и смотреть, где формируются новые ограничения и кто получает от них основную выгоду. Подробнее в следующих постах.
Post #152
159
- 👍 10
- 🔥 5
- ❤ 4