امروز مدل LongCat-2.0 منتشر شد (همون Owl Alpha معروف OpenRouter) یه غول 1.6T پارامتری MoE که فقط 48B فعال داره.
چیزی که برام جالب بود اینه که کل این پروژه روی ASICهای چینی (Huawei Ascend) جمع شده و خبری از NVIDIA نبوده. 35T توکن دیتا دیده و ادعا میکنن توی SWE-bench Pro حتی GPT-5.5 رو هم زده.
ساختارش بر پایه LongCat-Flash بنا شده ولی با یه سری خلاقیت جالب مثل N-gram Embedding که فضای Embedding رو بدون سنگین کردن Inference تا ۱۰۰ برابر بازتر میکنه.
واسه هندل کردن 1M Context اومدن LongCat Sparse Attention یا همون LSA رو دادن که یه جورایی تکاملیافته DeepSeek Sparse Attention محسوب میشه. سیستم Indexing رو سه لایه کردن (Streaming-aware، Cross-Layer و Hierarchical) تا کوئری زدن توی سکانسهای میلیونی، کمر سختافزار رو نشکنه.
من خودم تو پروژههای قبلی با مدلهای Long Context زیاد ور رفتم، معمولاً Performance بعد یه مدتی افت میکنه ولی اینا میگن روی صدها میلیارد توکن دیتای یک میلیون توکنی تمرینش دادن، یعنی فقط RoPE Scaling خالی نیست...
نکته اصلی اینه که کلاً Agent-centric طراحی شده. تمرکزش روی Tool Calling و Coding هست. با Claude Code و Hermes قشنگ جفتوجور میشه. قیمتگذاریاش هم برای ۱ میلیون توکن خروجی ۱.۲ دلاره که فعلاً رقابتیه.
هنوز فایل Weights توی Hugging Face نیست و فقط Model Card رو گذاشتن...
اینجا Technical blog اش رو میتونید بخونید:
https://longcat.chat/blog/longcat-2.0/
🛠 Join @LLMEngineers Community
Post #368
1.39K
- ❤ 4
- ⚡ 2
- 👍 1