واقعیت اینه که وقتی داری یه Agent میسازی که باید فرمت JSON برگردونه یا توی یه چارچوب امنیتی خاص کد بزنه، خلاقیت شاعرانه مدل به هیچ دردی نمیخوره. توی سال ۲۰۲۵، بحث از "آیا مدل میفهمه؟" به "آیا مدل اطاعت میکنه؟" تغییر کرده.
چند تا نکته فنی و دیتای به درد بخور از وضعیت فعلی Adherence براتون درآوردم:
معیار سنجش (Benchmarks) تغییر کرده
دیگه تستهای ساده Yes/No جواب نمیده. الان بنچمارکهایی مثل IFEval (که روی فرمت تمرکز داره) خوبن ولی کافی نیستن. ترند جدید AgentIF و AdvancedIF هستن. اینا میان سناریوهای Multi-turn و پیچیده رو تست میکنن. مثلاً مدل رو تو موقعیتی میذارن که ۱۲ تا Constraint مختلف داره (مثل "فقط اگه X بزرگتر از Y بود API رو کال کن، خروجی YAML باشه، و به Z اشاره نکن"). جالبه بدونید حتی مدلهای تاپ هم توی این سناریوها زیر ۳۰٪ پرفکت عمل میکنن.
وضعیت مدلها در ۲۰۲۵ (The Leaderboard)
طبق دیتای Vellum و SEAL، وضعیت فعلی اینطوریه:
مدل Claude 4.5 Sonnet با ۹۲٪ پایبندی، فعلاً پادشاه بلامنازع Instruction-following هست، مخصوصاً توی تسکهای طولانی.
مدل Grok-4 و GPT-5 با اختلاف کمی پشت سرش هستن.
نکته جذاب برای ما که دنبال هزینه کمتریم: توی دسته SLMها (مدلهای زیر ۳۲ میلیارد پارامتر)، مدل Qwen3-30B و Mistral Small 3 شاهکار کردن. اگر دارید روی Edge یا سیستمهای لوکال کار میکنید، Qwen3 با ۸۵٪ پایبندی، بهترین گزینه برای جایگزینی مدلهای گرونقیمته.
تکنیکهای بهبود (Optimization)
تکنیک RIFL (که یه پایپلاین RL هست) الان ترند شده برای اینکه Adherence رو بکشه بالا. به جای اینکه فقط روی دیتای SFT معمولی فاینتیون کنید، استفاده از RIFL و دیتای سینتتیک مثل Self-Instruct میتونه ۶ تا ۱۰ درصد پرفورمنس رو توی پیروی از دستورات بهتر کنه.
چالشهای امنیتی
به نظر من بزرگترین ترس الان Prompt Injection نیست، بلکه Context Drift توی پرامپتهای طولانیه. هرچی کانتکست طولانیتر میشه، مدل "نصیحتهای اول کار" (System Prompt) رو فراموش میکنه. بنچمارکها نشون میدن که Adherence با افزایش طول کانتکست، حدود ۲۰٪ افت میکنه.
اگه دارید سیستم Agentic میسازید، به جای اینکه فقط روی "هوش" مدل مانور بدید، روی ابزارهایی مثل
lm-evaluation-harness وقت بذارید و مطمئن بشید که مدل دقیقاً همون کاری رو میکنه که بهش گفتید، نه اون چیزی که خودش فکر میکنه درسته.📃 دیتاست AgentIF :
https://huggingface.co/datasets/THU-KEG/AgentIF
📃 مقاله:
AgentIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
🛠 Join @LLMEngineers Community