یکی از بزرگترین اشتباهات در توسعه ایجنتها، فرستادن کل تاریخچه چت در هر درخواست API است. با طولانی شدن مکالمه، تاخیر پاسخها بالا میرود و هزینه پردازش ابری چند برابر میشود.
راهکارهای دمدستی مثل کوتاه کردن تاریخچه باعث فراموشی ایجنت میشوند و تزریق مداوم فکتها به سیستم پرامپت هم کش پیشوند (Prefix Cache) را در ارائهدهندگانی مثل OpenAI و Anthropic کاملا از کار میاندازد.
در پروداکشن، معماری حافظه باید دو لایه باشد: پروفایل ثابت کاربر بلافاصله بعد از سیستم پرامپت قرار بگیرد تا کش دستنخورده بماند، و فکتهای پویای استخراجشده در انتهای پرامپت اضافه شوند. همچنین استخراج فکتها باید ناهمگام و در پسزمینه انجام شود.
در پست جدید MLnotes این معماری، جزئیات فنی و نحوه پیادهسازی آن را توضیح دادهام:
https://mlnotes.substack.com/p/stop-dumping-chat-history-into-context
@DevTwitter | <Mehdi Allahyari/>
Post #13367
1.64K

- ❤ 7
- 🍌 3