12 декабря Алексей Журин разобрал технический отчёт от DeepSeek: «DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models».
🎬Выкладываем запись встречи и делимся выводами:
🛑post-train через дистилляцию знаний от экспертов — топ;
🛑DeepSeek Sparse Attention (DSA) кратно снижает расходы на инференс моделей с большим контекстным окном;
🛑для тюнинга под агентские задачи авторы разработали пайплайн генерации агентских задач;
🛑в API модели появился reasoning tool-calling;
🛑DeepSeek v3.2 — самая экономичная SOTA модель в open-source.
#reading_group #recording #llm
Post #68
574