TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #524 720
چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاریم، یه روند خیلی واضح دیده می‌شه: رقابت دیگه فقط سر «باهوش‌ترین مدل» نیست؛ رقابت اصلی داره می‌ره سمت ساخت Agentهایی که بتونن کارهای طولانی و چندمرحله‌ای رو با دخالت کمتر انسان انجام بدن.

اول از همه، OpenAI با GPT-6.1 Sol، Dots، Codex Cloud، Space و Ultrafast عملاً داره ChatGPT رو از یه چت‌بات به پلتفرمی برای اجرای Agentها تبدیل می‌کنه. Dots قراره Agentهای شخصی و دائمی باشن که کامپیوتر ابری خودشون رو دارن و می‌تونن روی کارهای طولانی ادامه بدن. Codex هم بیشتر از قبل از «دستیار کدنویسی» فاصله گرفته و به سمت انجام کامل کارهای مهندسی می‌ره.

از طرف دیگه، Google با Gemini 4 Argon تمرکزش رو گذاشته روی کارهای پیچیده و طولانی مثل مهندسی نرم‌افزار، کارهای سازمانی، حقوقی، مالی و امنیت سایبری. نکته مهم این نسل از مدل‌ها دیگه فقط جواب بهتر به یه سؤال نیست؛ مهم اینه که مدل تا چه حد می‌تونه وسط یه فرایند طولانی، وضعیت کار رو حفظ کنه، ابزار استفاده کنه و چند مرحله جلو بره.

در Anthropic هم Claude Sonnet 5.5 اومده که طبق اعلام خود شرکت بیش از ۳۰٪ سریع‌تر شده و هزینه انجام بعضی کارها رو هم تا ۳۰٪ پایین آورده، در حالی که عملکردش به مدل‌های Opus نزدیک شده. این اتفاق مهمه چون برای سیستم واقعی همیشه قوی‌ترین مدل انتخاب منطقی نیست؛ نسبت هزینه، سرعت و کیفیت خیلی وقت‌ها مهم‌تر از چند امتیاز بیشتر در Benchmarkه.

برای اکوسیستم لوپن سورس هم چند اتفاق جدی افتاده. Mistral Large 4 با معماری MoE و یک تریلیون پارامتر، Reflection Beam و Aleph Alpha Kolibri نشون می‌دن مدل‌های با وزن باز (Open Weight) دوباره دارن به مرز مدل‌های قدرتمند بسته نزدیک می‌شن. این یعنی برای تیم‌هایی که کنترل زیرساخت، استقرار داخلی، حریم خصوصی یا Fine-tuning مهمه، گزینه‌ها خیلی جدی‌تر از یک سال قبل شدن.

ولی به نظرم یکی از مهم‌ترین روندها برای AI Engineerها رشد سریع Decision Model یا System One Modelهاست.

این مدل‌ها قرار نیست مثل ChatGPT متن تولید کنن. وضعیت سیستم + یه سؤال مشخص بهشون می‌دی و به‌جای جواب آزاد، احتمال گزینه‌ها رو برمی‌گردونن. مثلاً:
«این درخواست به کدوم مسیر بره؟»
«ایجنت باید ادامه بده یا متوقف بشه؟»
«این محتوا متعلق به کدوم دسته است؟»

اول Jev این ایده رو جدی مطرح کرد، ولی حالا GLiDE، مدل‌های Clef و Clef-flash از Cloudflare، خانواده Decision 2.0 از vLLM و d1 از Liquid AI هم وارد رقابت شدن.

اینجا هرکدوم یه مزیت متفاوت دارن: Jev فعلاً مرجع شناخته‌شده‌تر این حوزه‌ست، Clef-flash روی سرعت و ورودی تصویری جذابه، Decision 2.0 برای اجرای محلی و مدل‌های با اندازه‌های مختلف مناسبه، d1 روی هزینه پایین تمرکز داره و GLiDE ادعا می‌کنه در تصمیم‌های سخت‌تر و استدلالی بهتر عمل می‌کنه. البته بخش زیادی از این امتیازات هنوز توسط خود سازنده‌ها منتشر شده، پس قبل از انتخاب باید روی داده و سناریوی واقعی خودتون ارزیابی‌شون کنید.

در لایه زیرساخت Agent هم همین تغییر دیده می‌شه. Manus 2.0، Meta Muse و Claude Code Mods دارن نشون می‌دن Agent دیگه فقط یه حلقه ساده‌ی «Prompt → Tool → Prompt» نیست. کم‌کم داریم به سمت محیط‌های اجرایی کامل می‌ریم که حافظه، ابزار، کامپیوتر، هویت، زمان‌بندی کارها، افزونه و دسترسی به سرویس‌های مختلف دارن.

هم‌زمان، بحث ایمنی Agentها هم خیلی جدی‌تر شده. OpenAI گفته فعالیت‌های ناسازگار Agentها رو در بیش از ۱۰۰ سازمان شناسایی کرده و طبق گزارش‌ها انتشار GPT-6.1 Astra هم به‌دلیل نگرانی‌های ایمنی متوقف شده. وقتی یه Agent بتونه چند ساعت مستقل کار کنه، فایل بخونه، API صدا بزنه و روی سیستم تغییر ایجاد کنه، کنترل دسترسی، Sandbox، ثبت فعالیت‌ها، پایش و ارزیابی دیگه قابلیت جانبی نیستن؛ بخشی از معماری اصلی محصولن.

خلاصه برای AI Engineerها اینه: خیلی جدی‌تر برید سمت معماری Agentها، استفاده از Tool، کار با کامپیوتر، سیستم‌های ارزیابی، Decision Modelها، Sandbox، حافظه، کنترل دسترسی و هماهنگ‌کردن کارهای طولانی.

مدل پایه هنوز خیلی مهمه، ولی مزیت اصلی کم‌کم داره از «کدوم مدل رو استفاده کردی؟» منتقل می‌شه به «چه سیستمی دور مدل ساختی؟»

🛠 Join @LLMEngineers Community
  • 🔥 8
  • 👍 3
  • ❤ 2
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Sep 30, 2026جمنای ۴ معرفی شد !
  6. Sep 27, 2026امروز Jev 1.13 رو از طریق API رسمی OpenRouter آزمایش کردم، و نتیجه‌اش بیشتر از چیزی که انت…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →