واقعیت اینه که توی دنیای Agentها، مدل فقط حکم موتور رو داره؛ اون چیزی که واقعاً محصول نهایی رو میسازه Harness یا همون اسکلتبندی دور مدله. مثلا Claude 4.5 روی یه بنچمارک با یه Harness مشخص ۴۲٪ میگیره و با یه معماری دیگه به ۷۸٪ میرسه، بدون اینکه خود مدل ذرهای تغییری کرده باشه.
بزرگترین اشتباه اینه که فکر کنیم هرچی ابزار و Context بیشتری به مدل بدیم باهوشتر عمل میکنه. برعکس، تجربهی تیمهای موفقی مثل Cursor و Anthropic نشون میده که الگوهایی مثل Progressive Disclosure (نمایش تدریجی اطلاعات) چقدر حیاتیان. یعنی به جای خفه کردن مدل با حجم عظیمی از دیتا، باید اطلاعات رو فقط وقتی که واقعاً لازم شد و بهصورت لایهای به خوردش داد تا دچار Attention fragmentation نشه.
توی سیستمهایی مثل Claude Code، تمرکز روی سادگی لوپ و استفاده از ابزارهای ساده (مثل Grep و Bash) به جای پکیجهای سنگین و انتزاعی، هم هزینهی Token رو پایین آورده و هم دقت رو بالا برده. مدلها دارن به سمت "جایگزینپذیر" شدن میرن و فرق محصولی که واقعاً کار میکنه با یه دموی جذاب، توی همون مهندسی ظریفیه که دور مدل چیده شده.
Source: https://x.com/himanshutwtxs/article/2028116431876116660
🛠 Join @LLMEngineers Community
Post #352
1.44K
- 👌 10
- ❤ 3
- 🔥 2