TGViewer
DevTwitter | توییت برنامه نویسی DevTwitter | توییت برنامه نویسی @devtwitter · 32.2K subscribers
Post #13367 1.64K
یکی از بزرگ‌ترین اشتباهات در توسعه ایجنت‌ها، فرستادن کل تاریخچه چت در هر درخواست API است. با طولانی شدن مکالمه، تاخیر پاسخ‌ها بالا می‌رود و هزینه پردازش ابری چند برابر می‌شود.

راهکارهای دم‌دستی مثل کوتاه کردن تاریخچه باعث فراموشی ایجنت می‌شوند و تزریق مداوم فکت‌ها به سیستم پرامپت هم کش پیشوند (Prefix Cache) را در ارائه‌دهندگانی مثل OpenAI و Anthropic کاملا از کار می‌اندازد.

در پروداکشن، معماری حافظه باید دو لایه باشد: پروفایل ثابت کاربر بلافاصله بعد از سیستم پرامپت قرار بگیرد تا کش دست‌نخورده بماند، و فکت‌های پویای استخراج‌شده در انتهای پرامپت اضافه شوند. همچنین استخراج فکت‌ها باید ناهمگام و در پس‌زمینه انجام شود.

در پست جدید MLnotes این معماری، جزئیات فنی و نحوه پیاده‌سازی آن را توضیح داده‌ام:
https://mlnotes.substack.com/p/stop-dumping-chat-history-into-context

@DevTwitter | <Mehdi Allahyari/>
  • ❤ 7
  • 🍌 3
More from @devtwitter
  1. Sep 28, 2026اگر از Qdrnat به عنوان Vector Database استفاده می کنید، در نسخه 1.19 دو اپراتور فیلتر جدید…
  2. Sep 28, 2026یه چیزی که خودم این روزها بهش فکر می‌کنم، خرید قسطی آیفونه با این تورم، ترجیح می‌دم پولم ر…
  3. Sep 28, 2026هوش مصنوعی Qwen نسخه پولی نرم‌افزار IDM را کرک کرد در ردیت، کاربری با کمک مدل «Qwen3.8-Fla…
  4. Sep 28, 2026هارنس Condor (در حوزه الگوترید) توسط تیم شناخته‌شده Hummingbot ساخته شده که تصمیم LLM را ب…
  5. Sep 28, 2026🚀 فورکودر؛ ایجنت کدنویسی که از اشتباهاتش یاد می‌گیره! 🧠 خطاهای تکراری، مصرف توکن و زمانت…
  6. Sep 28, 2026چجوری DeepSeek v4.1 فلش رو jailbreak کنیم ؟ نحوه اجرا: فولدر بسازید، با OpenCode باز کنید،…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →