Что интересно про DeepSeek так это объем железа для обучения.
По официальному репорту, DeepSeek тренировался на кластере из 2k H800. Это смешной размер для таких задач. Это примерно в 50 раз меньше чем кластер для обучения любой большой модели в US.
Слухи ходят что они не раскрывают данные о реальном кластере. Китаю нельзя официально иметь кластера на H100 и других топовых картах любого крупного размера.
Я в Китае был сам и инженеры там лично говорят что кластера на 50-100к у них конечно есть. Раскрывать они их не могут.
С другой стороны, DeepSeek выпустили вместе с моделью подробный тех репорт с указанием размеров кластеров и так далее. И там все бьётся нормально - объёмы данных и времени вполне совпадают с объёмом железа, это подтвердили более-менее все лидеры индустрии.
Если это и правда возможно на кластере в 2k, значит и другие страны могут так же и стены в 100k кластера не существует.
Post #179
4.85K
- 🤔 28
- 🔥 17
- ❤ 7
- 💅 4