TGViewer
How to AI in Farsi How to AI in Farsi @mlinfarsi · 1.13K subscribers
Post #501 216
وقتی در حال توسعه یک ایجنت هستید، بعد از چند پیام ابتدایی همه‌چیز عالی به نظر می‌رسد؛ اما با رسیدن به پیام پانزدهم، ناگهان تاخیر پاسخ‌ها از چند صد میلی‌ثانیه به چند ثانیه می‌رسد و هزینه پردازش ابری چندین برابر می‌شود. دلیل آن ساده است: فرستادن کل تاریخچه چت در هر فراخوانی API.

دو راهکار دم‌دستی معمولاً برای حل این مشکل استفاده می‌شود:
• کوتاه کردن تاریخچه: کاهش هزینه به قیمت فراموشی سریع ایجنت و از دست رفتن زمینه‌های قبلی.
• تزریق ناشیانه حافظه در پرامپت سیستم: تغییر مداوم متن سیستم پرامپت که باعث نابودی کامل Prefix Cache در ارائه‌دهندگانی مثل OpenAI یا Anthropic می‌شود و هزینه تمام توکن‌ها را به قیمت ۱۰۰٪ محاسبه می‌کند.

معماری حافظه در ایجنت‌های سطح پروداکشن باید چند اصل کلیدی را رعایت کند:
• استخراج ناهمگام (Asynchronous): فرایند استخراج فکت‌ها در پس‌زمینه اجرا شود تا درخواست کاربر معطل نماند.
• ساختار دومرحله‌ای پرامپت (Dual-Tier Architecture): قرار دادن اطلاعات ثابت کاربر بعد از سیستم پرامپت برای کش ماندن ۹۵٪ توکن‌ها، و اضافه کردن حافظه‌های پویای استخراج‌شده در انتهای پرامپت.
• محدودیت‌های منفی در استخراج: تعیین دقیق مواردی که نباید ذخیره شوند تا پایگاه حافظه با نویز پر نشود.

در پست جدید خبرنامه MLnotes، این معماری و نحوه پیاده‌سازی آن را به همراه جزئیات فنی و دیاگرام معماری بررسی کرده‌ام:

🔗 https://mlnotes.substack.com/p/stop-dumping-chat-history-into-context
Substack Stop Dumping Chat History into Context The 4 architectural decisions behind production agent memory
More from @mlinfarsi
  1. Sep 22, 2026هر مهندس نرم‌افزاری که شیفت On-Call داشته باشد، حس بد آلارم‌های ساعت ۳ نیمه‌شب را خوب می‌ش…
  2. Sep 19, 2026در آخرین مقاله خبرنامه Substack، به سراغ مدلی رفتم که این روزها سر و صدای زیادی در جامعه ه…
  3. Sep 16, 2026مهندسان اوبر در یک مقاله فنی جدید توضیح داده‌اند که چطور توانستند تاخیر (Latency) جستجو در…
  4. Sep 14, 2026video post
  5. Sep 14, 2026نسخه‌ی جدید Pocket TTS Farsi v2 منتشر شد! تبدیل متن فارسی به گفتار که روی CPU اجرا می‌شه؛…
  6. Sep 12, 2026این ویدیو از این ریپو
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →