Как сделать RAG в 32 раза более эффективным по памяти 😨
Существует простая техника, широко используемая в индустрии, которая делает RAG примерно в 32 раза более эффективным по памяти.
Perplexity использует её в своём поисковом индексе. Azure в своём поисковом пайплайне. HubSpot в своём AI-ассистенте
Чтобы в этом разобраться, вот гайд, где ты построишь RAG-систему, которая выполняет запросы к 36M+ векторам за <30 мс.
И техника, которая это обеспечит, называется бинарная квантизация.
Post #2927
11.2K