دیپسیک مدل DeepSeek-V4.1-Flash را با معماری MoE و ۵۵۲ میلیارد پارامتر معرفی کرده؛ مدلی چندوجهی که برای کدنویسی، استفاده از ابزارها و انجام وظایف Agentic بهینه شده و از پردازش تصویر هم پشتیبانی میکند.
معماری جدید Causal Encoder–Decoder هنگام پردازش ورودی فقط ۸ میلیارد و هنگام تولید خروجی ۱۶ میلیارد پارامتر را فعال میکند. حجم KV Cache نیز نسبت به نسل قبل به یکچهارم HBM و یکهشتم فضای SSD کاهش یافته است.
هزینه ورودی بدون Cache Hit از ۰٫۱۵ دلار بهازای هر یک میلیون توکن در ساعات کممصرف شروع میشود. مدل با نام deepseek-flash از طریق API در دسترس است و وزنهای آن با مجوز MIT در Hugging Face منتشر شدهاند.
🔗 منبع: DeepSeek
🔹 تلگرام . یوتیوب . توییتر . لینکدین
هوشمصنوعی در پژوهش، بروزترین ارائهدهنده اخبار هوشمصنوعی




