مدل زبانی بهتنهایی فقط یه پیشبینیکنندهی متنه. برای اینکه بتونه کار واقعی انجام بده، به یه لایهی نرمافزاری دور خودش نیاز داره که ابزارها، حافظه و منطق اجرا رو بهش بده؛ به این لایه میگن Agent Harness.
مدل مثل مغز عمل میکنه. اون لایهی اطرافش، مثل چشم، دست، محیط کار و ترمز ماشینه.
یه مدل خام نهایتاً میتونه یه دستور ترمینال رو پیشنهاد بده. این لایهی مدیریتکننده است که اون دستور رو اجرا میکنه، خروجیش رو میخونه، میفهمه خطا داده یا نه و دوباره تلاش میکنه.
تو یه ساختار استاندارد، این لایه چند تا کار مهم میکنه.
اولین مورد مدیریت زمینهست. تصمیم میگیره چه فایلها و تاریخچهای رو به مدل بده.
بعدی چرخهی اجراست. همون روند تکراریِ بررسی، تصمیمگیری، استفاده از ابزار و دیدن نتیجه؛ که بهش میگن Agent Loop.
دسترسی به فایلها، حافظهی پروژه، بررسی خطاهای امنیتی و تستهای خودکار هم همگی بخشی از همین سیستم هستن.
همین لایهی نرمافزاری بهشدت مهمه. یه مدل ثابت تو دو تا محیط مختلف، خروجیهای کاملاً متفاوتی میده.
طبق بررسیها، گاهی اوقات تغییر این لایه میتونه میزان موفقیت مدل رو چند برابر کنه یا مصرف توکن رو بهشدت تغییر بده. برای همین مقایسهی دو تا مدل بدون در نظر گرفتن این ساختار کلاً اشتباهه.
حالا دو تا نمونهی پرکاربرد داریم. اولی ابزار رسمی انتروپیکه.
کلاود کد بهشدت با محیط برنامهنویسی و ترمینال یکپارچه شده. برای کار روی فایلهای پروژه عالیه، ولی هزینهی توکنش بالاست.
دومی یه پروژهی متنباز و منعطفه. هرمس ایجنت برای ساخت دستیارهای شخصی و کارهای عمومیتر طراحی شده.
ویژگی اصلی هرمس اینه که به یه ارائهدهنده محدود نیست. میتونی از مدلهای لوکال، سرویسهای ارزون یا ترکیب چند تا ایجنت برای کاهش هزینه توش استفاده کنی.
هزینهی این ابزارها خیلی راحت از کنترل خارج میشه. بزرگترین اشتباه اینه که برای کارهای ساده از قویترین مدل استفاده کنی.
برای کارهای مکانیکی، مرتبسازی و فیلتر کردن فقط از اسکریپتهای برنامهنویسی استفاده کن. هیچوقت مدل زبانی رو درگیر کارهای قطعی نکن.
برای خلاصهسازی و کارهای روتین، مدلهای ارزونتر رو بذار و مدلهای گرون رو فقط برای معماری و باگهای پیچیده نگه دار.
محتوای ورودی رو محدود نگه دار. هرچی ابزار و دستورالعمل دائمی بیشتری تعریف کنی، توکن بیشتری هدر میره.
ابزارهایی که لازم نداری رو غیرفعال کن. تو هرمس بهتره به جای یه دستیار همهکاره، چند تا پروفایل جداگانه برای برنامهنویسی، تحقیق یا کارهای سرور بسازی.
تو کلاود کد هم بعد از تموم شدن هر تسک، حتماً تاریخچه رو با دستور
clear/ پاک کن تا هزینهی اضافی ندی.تأیید نهایی رو به خود مدل نسپار.
اینکه مدل بهت بگه کار تموم شده، معیار خوبی نیست. به جاش از تستهای نرمافزاری، لینترها و چککردن نوع دادهها استفاده کن.
وقتی تستها پاس بشن، یعنی کار واقعاً تموم شده.
ترکیب منطقی برای کار روزمره اینه:
برای پروژههای برنامهنویسی سنگین، مستقیم از کلاود کد یا کدکس و مدلهای متوسطش استفاده کن. یک تسک رو پیش ببر و بعد تاریخچه رو ببند.
برای کارهای جانبی، جستجوها و اتوماسیون سرور، هرمس رو با مدلهای ارزونتر یا لوکال بیار بالا.
فقط جایی پول توکن بده که واقعاً نیاز به تصمیمگیری و منطق پیچیده باشه.
🛠 Join @LLMEngineers Community