چند روز اخیر پر از خبر AI بود، ولی وقتی تکراریها، لیکها و تغییرات کماهمیت رو کنار بذاریم، یه روند خیلی واضح دیده میشه: رقابت دیگه فقط سر «باهوشترین مدل» نیست؛ رقابت اصلی داره میره سمت ساخت Agentهایی که بتونن کارهای طولانی و چندمرحلهای رو با دخالت کمتر انسان انجام بدن.
اول از همه، OpenAI با GPT-6.1 Sol، Dots، Codex Cloud، Space و Ultrafast عملاً داره ChatGPT رو از یه چتبات به پلتفرمی برای اجرای Agentها تبدیل میکنه. Dots قراره Agentهای شخصی و دائمی باشن که کامپیوتر ابری خودشون رو دارن و میتونن روی کارهای طولانی ادامه بدن. Codex هم بیشتر از قبل از «دستیار کدنویسی» فاصله گرفته و به سمت انجام کامل کارهای مهندسی میره.
از طرف دیگه، Google با Gemini 4 Argon تمرکزش رو گذاشته روی کارهای پیچیده و طولانی مثل مهندسی نرمافزار، کارهای سازمانی، حقوقی، مالی و امنیت سایبری. نکته مهم این نسل از مدلها دیگه فقط جواب بهتر به یه سؤال نیست؛ مهم اینه که مدل تا چه حد میتونه وسط یه فرایند طولانی، وضعیت کار رو حفظ کنه، ابزار استفاده کنه و چند مرحله جلو بره.
در Anthropic هم Claude Sonnet 5.5 اومده که طبق اعلام خود شرکت بیش از ۳۰٪ سریعتر شده و هزینه انجام بعضی کارها رو هم تا ۳۰٪ پایین آورده، در حالی که عملکردش به مدلهای Opus نزدیک شده. این اتفاق مهمه چون برای سیستم واقعی همیشه قویترین مدل انتخاب منطقی نیست؛ نسبت هزینه، سرعت و کیفیت خیلی وقتها مهمتر از چند امتیاز بیشتر در Benchmarkه.
برای اکوسیستم لوپن سورس هم چند اتفاق جدی افتاده. Mistral Large 4 با معماری MoE و یک تریلیون پارامتر، Reflection Beam و Aleph Alpha Kolibri نشون میدن مدلهای با وزن باز (Open Weight) دوباره دارن به مرز مدلهای قدرتمند بسته نزدیک میشن. این یعنی برای تیمهایی که کنترل زیرساخت، استقرار داخلی، حریم خصوصی یا Fine-tuning مهمه، گزینهها خیلی جدیتر از یک سال قبل شدن.
ولی به نظرم یکی از مهمترین روندها برای AI Engineerها رشد سریع Decision Model یا System One Modelهاست.
این مدلها قرار نیست مثل ChatGPT متن تولید کنن. وضعیت سیستم + یه سؤال مشخص بهشون میدی و بهجای جواب آزاد، احتمال گزینهها رو برمیگردونن. مثلاً:
«این درخواست به کدوم مسیر بره؟»
«ایجنت باید ادامه بده یا متوقف بشه؟»
«این محتوا متعلق به کدوم دسته است؟»
اول Jev این ایده رو جدی مطرح کرد، ولی حالا GLiDE، مدلهای Clef و Clef-flash از Cloudflare، خانواده Decision 2.0 از vLLM و d1 از Liquid AI هم وارد رقابت شدن.
اینجا هرکدوم یه مزیت متفاوت دارن: Jev فعلاً مرجع شناختهشدهتر این حوزهست، Clef-flash روی سرعت و ورودی تصویری جذابه، Decision 2.0 برای اجرای محلی و مدلهای با اندازههای مختلف مناسبه، d1 روی هزینه پایین تمرکز داره و GLiDE ادعا میکنه در تصمیمهای سختتر و استدلالی بهتر عمل میکنه. البته بخش زیادی از این امتیازات هنوز توسط خود سازندهها منتشر شده، پس قبل از انتخاب باید روی داده و سناریوی واقعی خودتون ارزیابیشون کنید.
در لایه زیرساخت Agent هم همین تغییر دیده میشه. Manus 2.0، Meta Muse و Claude Code Mods دارن نشون میدن Agent دیگه فقط یه حلقه سادهی «Prompt → Tool → Prompt» نیست. کمکم داریم به سمت محیطهای اجرایی کامل میریم که حافظه، ابزار، کامپیوتر، هویت، زمانبندی کارها، افزونه و دسترسی به سرویسهای مختلف دارن.
همزمان، بحث ایمنی Agentها هم خیلی جدیتر شده. OpenAI گفته فعالیتهای ناسازگار Agentها رو در بیش از ۱۰۰ سازمان شناسایی کرده و طبق گزارشها انتشار GPT-6.1 Astra هم بهدلیل نگرانیهای ایمنی متوقف شده. وقتی یه Agent بتونه چند ساعت مستقل کار کنه، فایل بخونه، API صدا بزنه و روی سیستم تغییر ایجاد کنه، کنترل دسترسی، Sandbox، ثبت فعالیتها، پایش و ارزیابی دیگه قابلیت جانبی نیستن؛ بخشی از معماری اصلی محصولن.
خلاصه برای AI Engineerها اینه: خیلی جدیتر برید سمت معماری Agentها، استفاده از Tool، کار با کامپیوتر، سیستمهای ارزیابی، Decision Modelها، Sandbox، حافظه، کنترل دسترسی و هماهنگکردن کارهای طولانی.
مدل پایه هنوز خیلی مهمه، ولی مزیت اصلی کمکم داره از «کدوم مدل رو استفاده کردی؟» منتقل میشه به «چه سیستمی دور مدل ساختی؟»
🛠 Join @LLMEngineers Community
Post #524
720
- 🔥 8
- 👍 3
- ❤ 2