یکی از مهمترین خبرهای دنیای AI در۲۰۲۶ بدون اغراق میتونه همین باشه!
یه شرکت به اسم Subquadratic ، مدل جدیدی به اسم SubQ معرفی کرده که میتونه کل بازی مدلهای زبانی رو تغییر بده.
داستان از یه مشکل قدیمی شروع میشه؛ تقریباً همه مدلهای معروف دنیا مثل GPT، Claude و Gemini روی معماری Transformer ساخته شدن.
مشکل Transformer اینه که وقتی متن خیلی طولانی میشه، هزینه پردازش به شکل نمایی بالا میره.
یعنی اگه طول Context دو برابر بشه، Compute فقط دو برابر نمیشه؛ تقریباً ۴ برابر میشه. و اگر سه برابر بشه، حدود ۹ برابر!
همین باعث شده حتی قویترین مدلهای امروز هم روی Contextهای خیلی بزرگ هم گرون بشن هم کند.
حالا SubQ اومده با ابداع الگوریتم جدید دقیقاً همین مشکل رو حل کنه.
به جای اینکه همه ارتباطهای ممکن بین توکنها رو حساب کنه، فقط اون ارتباطهایی رو پردازش میکنه که واقعاً مهم هستن.
یعنی Compute هدر نمیره.
نتیجه اینکه Scaling تقریباً خطی میشه به جای نمایی
و Contextهای خیلی طولانی خیلی ارزونتر پردازش میشن.
و سرعت اجرای مدل به شدت بیشتر میشه
اعدادی که منتشر شده هم قابل توجه هستند:
روی Context دوازده میلیون توکنی، مصرف Compute تقریباً ۱۰۰۰ برابر کمتر از مدلهای معمولیه
و روی یک میلیون توکن، حدود ۵۲ برابر سریعتر از FlashAttention اجرا میشه
جالبتر اینکه دقت مدل هم افت نکرده.
روی Benchmark معروف RULER 128K:
SubQ امتیاز 95٪ گرفته
Claude Opus 4.6 امتیاز 94.8٪
روی SWE-Bench Verified هم:
SubQ امتیاز 81.8 گرفته
Claude Opus 4.6 امتیاز 80.8
حتی از DeepSeek 4.0 Pro هم جلو زده
اما قسمت دیوونهکننده ماجرا هزینه اجراشه.
این شرکت ادعا کرده هزینه این مدل کمتر از 1.5 دلار برای هر یک میلیون توکنه؛ یعنی کمتر از ۵٪ هزینه Claude Opus.
مثلاً اجرای تست RULER:
روی SubQ فقط ۸ دلار هزینه داشته
روی Claude Opus حدود ۲۶۰۰ دلار
یعنی حدود ۳۰۰ برابر ارزونتر، با دقت برابر یا حتی بهتر.
این شرکت تا الان ۲۹ میلیون دلار سرمایه جذب کرده و API مدل هم الان برای Early Access باز شده.
@Algoticai #subq