DeepSeek: китайская альтернатива OpenAI или просто очередной хайп?
Постарался разобраться, насколько реальны домыслы СМИ о том, что китайский стартап DeepSeek создал конкурентоспособную модель за смешные $5–6 млн. Но реальность, как всегда, сложнее. Разбираемся, что тут правда, а что очередной виток шумихи вокруг ИИ.
Кто стоит за DeepSeek?
Проект разрабатывается очевидно очень сильной командой инженеров и исследователей в Китае, которые активно публикуют свои наработки и этим сильно отличаются от OpenAI и Claude. Основатель имеет опыт найма квантов, - а это верх современной прикладной математики, потому что проверка происходит своими деньгами. Также, на поверхности лежит, то что люди из хедж фондов знают как зашортить американские акции типа NVIDIA и понимали, что новость взорвет рынок.
Сколько на самом деле стоит DS?
Цифра в $5–6 млн — это только стоимость одной тренировки модели на 2048 NVIDIA H800. Однако реальная цена разработки намного выше. Учитывая тестирование, подбор данных и эксперименты, речь идёт скорее о сотнях миллионов долларов. Вдобавок, DeepSeek принадлежит крупному китайскому хедж-фонду, у которого явно больше 2048 GPU.
Как устроен DS R1?
- Использует архитектуру Mixture-of-Experts (MoE) — активируется только часть модели, что делает её быстрее и эффективнее.
- MoE уже пробовали Mistral (Mixtral), но DeepSeek реализовали её более успешно.
- Некоторые техники DeepSeek использовались ещё в DeepSeekMath, но последняя версия получила значительные улучшения.
Что с данными для обучения?
На чём именно обучалась DS R1 — пока неизвестно. Напрямую скопировать OpenAI невозможно, поскольку они не раскрывают своих внутренних механизмов. Однако при наличии мощных GPU можно использовать OpenAI как “учителя” и затем дообучать RL-модели.
DeepSeek vs. OpenAI
DS R1 часто сравнивают с ранними версиями OpenAI. Это логично: OpenAI породил хайп, а теперь появился его открытый аналог. Подобное уже было с LLaMA 3 400B, которая стала бесплатной альтернативой GPT-4o.
Качество и перспективы
- DS R1 — лучшая открытая модель для логических задач, но пока не универсальна.
- Для мультиязычного использования больше подходят другие модели.
- Полные версии R1/V3 огромны (600B+ параметров), но их можно сжать до 30B, что делает их удобнее.
Будущее
В ближайшие месяцы появятся новые бенчмарки, где R1/O1 не покажут идеальные результаты. Затем Google и OpenAI выпустят ещё более продвинутые модели, а кто-то с доступом к мощным GPU сделает открытую версию на их уровне (DeepSeek или кто-то ещё).
Но здесь главное — цена. Создание таких моделей требует не $5–6 млн, а пока скорее $50–100 млн.
Ключевой вывод
DeepSeek всколыхнул, но не перевернул рынок ИИ. Он просто подтвердил то, что уже было очевидно. Большие проприетарные модели никогда не были главной ценностью для корпоративного ИИ. Самый позитивный сигнал для рынка - цена токена будет падать и очень быстро. У сейчас можно перестроить часть запросов на DeepSeek и платить меньше.
Всё решают ваши данные.
Большие языковые модели — это уже Commodity. Если не использовать их правильно, они бесполезны, как кусок глины на столе. Но если вы “слепите” из них что-то ценное с помощью тщательно отобранных, определённых и правильно управляемых собственных данных, то получите пользу для реального бизнеса.
Max Votek - Мысли вслух. Канал о предпринимательстве, AI и инвестициях 🔠🔠
Post #128
1.05K
- 👍 12
- ❤ 7
- 🔥 6