Очень интересно, что сейчас происходит из-за DeepSeek r1. Для тех, кто не следил:
1. Чуваки смогли обучить LLM, которая почти не хуже, чем у OpenAI.
2. Сделали это в 20 раз дешевле и написали подробную статью как это сделали.
3. Сотрудники из фейсбука на форумах пишут чуть ли не о панике в руководстве, что так дешево можно делать такие модели.
4. Приложение DeepSeek в топе американского стора.
5. Акции крупных компаний падают на премаркете (насдак еще не открылся). Акции nvidia падают почти на 12% на премаркете.
С 2022 года после выхода ChatGPT это первое событие, которое вызвало такой бурный ажиотаж. Представьте, основные игроки в индустрии думают, что нужно очень много денег, анонсируют stargate на 500млрд$. И тут оказывается, что можно сделать то же самое в 20 раз дешевле.
Есть нюансы. Китайцы не могут нормально рассказывать про мощности. Потому что санкции. Поэтому есть некоторые риски, что сказали неправду и использовали больше мощностей.
Но лично я не думаю. Статья есть, нужен примерно квартал, чтобы ее повторили самые быстрые конкуренты. На код и эксперименты около месяца, плюс месяца два на обучение и все проверки. Думаю увидим подтверждение.
Ноу хау в том, что придумали как делать обучение с подкреплением по-другому.
Интересно, а ведь год только начался!
Post #142
6.51K
- ❤ 70
- 👍 31
- 🔥 25
- ❤🔥 3
- 🤔 2