Под конец года многие компании порадовали нас новыми интересными релизами своих LLM. Только за последний месяц мы получили Gemini 3 Pro, Kimi-k2-thinking, GPT 5.1 и 5.2, Claude Opus 4.5, Mistral 3 и кучу других SOTA-моделей.
Что общего у этих релизов? Ни один из них не сопровождался какими-либо подробностями о внутреннем устройстве моделей. Но первого декабря небезызвестная компания DeepSeek выложила в открытый доступ LLM DeepSeek-V3.2 и DeepSeek-V3.2-Speciale, которые уделывают на бенчмарках почти все closed и open source модели.
На предстоящей встрече PT ML Reading Group специалист ML-команды Алексей Журин разберёт вышедший вместе с релизом технический отчёт «DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models».
На встрече выясним:
🔵что общего у DeepSeek-V3.2 с предыдущими релизами;
🔵какие проблемы, по мнению компании DeepSeek, мешают создавать качественные open-source-модели;
🔵как работает DeepSeek Sparse Attention;
🔵зачем для обучения LLM потребовалось генерировать синтетические данные;
🔵чего стоит ждать от следующих релизов DeepSeek.
📅Встречаемся в пятницу, 12 декабря, в 15:00 МСК
🔗Подключайтесь: Ктолк
#reading_group #llm
Post #65
692

- 🔥 8
- ❤ 5
- 👍 2