TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #272 1.14K
همه درگیر بنچمارک‌های Reasoning و MMLU شدن، ولی اون چیزی که تو پروداکشن (Production) و مخصوصاً سیستم‌های Agentic مو رو از ماست می‌کشه بیرون، System Prompt Adherence (پایبندی به پرامپت سیستم) هست.

واقعیت اینه که وقتی داری یه Agent می‌سازی که باید فرمت JSON برگردونه یا توی یه چارچوب امنیتی خاص کد بزنه، خلاقیت شاعرانه مدل به هیچ دردی نمی‌خوره. توی سال ۲۰۲۵، بحث از "آیا مدل می‌فهمه؟" به "آیا مدل اطاعت می‌کنه؟" تغییر کرده.

چند تا نکته فنی و دیتای به درد بخور از وضعیت فعلی Adherence براتون درآوردم:

معیار سنجش (Benchmarks) تغییر کرده
دیگه تست‌های ساده Yes/No جواب نمیده. الان بنچمارک‌هایی مثل IFEval (که روی فرمت تمرکز داره) خوبن ولی کافی نیستن. ترند جدید AgentIF و AdvancedIF هستن. اینا میان سناریوهای Multi-turn و پیچیده رو تست می‌کنن. مثلاً مدل رو تو موقعیتی میذارن که ۱۲ تا Constraint مختلف داره (مثل "فقط اگه X بزرگتر از Y بود API رو کال کن، خروجی YAML باشه، و به Z اشاره نکن"). جالبه بدونید حتی مدل‌های تاپ هم توی این سناریوها زیر ۳۰٪ پرفکت عمل می‌کنن.

وضعیت مدل‌ها در ۲۰۲۵ (The Leaderboard)
طبق دیتای Vellum و SEAL، وضعیت فعلی اینطوریه:
مدل Claude 4.5 Sonnet با ۹۲٪ پایبندی، فعلاً پادشاه بلامنازع Instruction-following هست، مخصوصاً توی تسک‌های طولانی.
مدل Grok-4 و GPT-5 با اختلاف کمی پشت سرش هستن.
نکته جذاب برای ما که دنبال هزینه کمتریم: توی دسته SLMها (مدل‌های زیر ۳۲ میلیارد پارامتر)، مدل Qwen3-30B و Mistral Small 3 شاهکار کردن. اگر دارید روی Edge یا سیستم‌های لوکال کار می‌کنید، Qwen3 با ۸۵٪ پایبندی، بهترین گزینه برای جایگزینی مدل‌های گرون‌قیمته.

تکنیک‌های بهبود (Optimization)
تکنیک RIFL (که یه پایپ‌لاین RL هست) الان ترند شده برای اینکه Adherence رو بکشه بالا. به جای اینکه فقط روی دیتای SFT معمولی فاین‌تیون کنید، استفاده از RIFL و دیتای سینتتیک مثل Self-Instruct می‌تونه ۶ تا ۱۰ درصد پرفورمنس رو توی پیروی از دستورات بهتر کنه.

چالش‌های امنیتی
به نظر من بزرگترین ترس الان Prompt Injection نیست، بلکه Context Drift توی پرامپت‌های طولانیه. هرچی کانتکست طولانی‌تر میشه، مدل "نصیحت‌های اول کار" (System Prompt) رو فراموش می‌کنه. بنچمارک‌ها نشون میدن که Adherence با افزایش طول کانتکست، حدود ۲۰٪ افت می‌کنه.

اگه دارید سیستم Agentic می‌سازید، به جای اینکه فقط روی "هوش" مدل مانور بدید، روی ابزارهایی مثل lm-evaluation-harness وقت بذارید و مطمئن بشید که مدل دقیقاً همون کاری رو می‌کنه که بهش گفتید، نه اون چیزی که خودش فکر می‌کنه درسته.

📃 دیتاست AgentIF :
https://huggingface.co/datasets/THU-KEG/AgentIF

📃 مقاله:
AgentIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios


🛠 Join @LLMEngineers Community
  • 👍 5
  • 👎 3
  • ❤ 2
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →