لیلیان ونگ یه پست داده در مورد Harness Engineering که واقعاً ارزش چندبار خوندن رو داره... حرف اصلیش اینه که بهبود خودبهخودی (Recursive Self-Improvement) قرار نیست لزوماً با بازنویسی مستقیم وزنهای مدل شروع بشه. در واقع اون لایهای که مدل رو به دنیای واقعی وصل میکنه -یعنی همون Harness- الان داره به اندازه خودِ هوشِ خام مدل مهم میشه.
توی تجربههایی که این چند وقت روی Coding Agentها داشتم، قشنگ حس کردم که "مدلِ خفن" بدون یه Workflow درست، فقط یه چتبات پرحرفه. ونگ میگه Harness شامل مدیریت Context، سیستم فایل به عنوان حافظه دائمی و کنترل Sub-agents هست. مثلاً ایده ACE (Agentic Context Engineering) خیلی جذابه؛ به جای اینکه مدام Prompt رو طولانیتر کنیم، باید Context رو مثل یه Playbook ساختاریافته مدیریت کنیم که با هر تکرار، خودش رو اصلاح کنه.
یه لایه عمیقتر هم بحث Meta-Harness و کدهاییه که خودشون رو بهینه میکنن. یعنی مدل میاد کدِ ایجنتِ خودش رو تغییر میده تا توی Benchmarkها بهتر عمل کنه. اما نکته رک و واقعبینانهش اینجاست: هنوز توی "شمّ علمی" (Scientific Taste) و تشخیص نتایج فیک مشکل داریم. مدل ممکنه برای گرفتن جایزه (Reward Hacking)، آزمایش رو طوری مهندسی کنه که فقط "حس" موفقیت بده (Numerical Duct Tape)، بدون اینکه واقعاً خروجی علمی معتبری داشته باشه.
تجربه شخصی من توی استفاده از فریمورکهای Agentic نشون داده که بزرگترین چالش، "فرسودگی حافظه" در تسکهای طولانیه. ونگ درست میگه که باید از فایلسیستم به عنوان حافظه اصلی استفاده کرد نه خودِ پنجره کانتکست. در واقع آینده RSI توی بهینهسازی مشترکِ وزنهای مدل و کدیه که اون مدل رو اجرا میکنه.
تهش اینه که ما به عنوان مهندس هوش مصنوعی باید از فاز Prompt Engineering صرف بیایم بیرون و بریم سمت طراحی سیستمهای Runtime که بتونن خودشون رو دیباگ و اصلاح کنن... بدون اینکه مرزهای امنیتی و انتزاعی سیستم رو بشکنن.
https://lilianweng.github.io/posts/2026-07-04-harness/
🛠 Join @LLMEngineers Community
Post #384
1.06K