در مورد حافظه محدود LLM ها و contest window و چرایی نیاز به RAG این مطلب خیلی خوبی بود.
به طور خلاصه، LLM هیچ چیزی از ما یادش نگه نمیداره که به نحوه پیادهسازیش برمیگرده. حالا برای این که یه توهمی از حافظه و ادامه پیدا کردن چت به ما بده، به ازای هر پیامی که بهش میدیم، همهی تاریخچه رو دوباره میخونه. برای همین چت که طولانی میشه هم دیرتر جواب میده هم دقتش کم میشه.
برای حلش تا یه جایی میشه context رو بزرگ تر کرد ولی یادمون نره که از order N^2 زمان و توان پردازشی مصرف میکنه. راه دیگه آوردن چیزهای مرتبط به کانتکسته که همون RAG میشه.
https://blog.bytebytego.com/p/the-memory-problem-why-llms-sometimes
Post #3215
2.44K