RAG SOTA benchmarks
RAG как инструмент подключения базы знаний и обогащения контекста для LLM - это база. Классический пайплайн обычно включает в себя Hybrid Retrieval с разными фильтрациями (BM25 + семантика + другие способы построения ретривала) и хитрым Context Engineering. Все это заправляется реранкером и сжатием контекста через суммаризацию. Еще можно поработать с самим запросом (Step-back prompting), чтобы помочь ретриверу. Можно также добавить агентности, если много времени (с планнингом, инструментами поиска данных и итеративным ретривером).
В твиттере активно продвигалась история с графовыми RAG и PageIndex как альтернатива векторным базам. Вот как раз lightRAG - хитрая история о том, как собрать базу знаний в граф.
Еще, если поискать, по RAG есть интересная статья - RAPTOR. Как некое развитие графовой истории, это про использование дерева с кластеризацией листьев и последующей суммаризацией самой LLM.
Давайте соберем все это вместе, назовем SEQUOIA (раз уж она про деревья) или Semantic-Evolved QUery-Optimized Iterative Abstraction, сделаем свой бенчмарк и посмотрим, как это выстрелит. Да, LLM будет локальная и немного слабоватая, но все равно на тесты я потратил в сумме более 20 часов работы своей машины.
Результаты ошеломляющие 💃: LlamaIndex и LightRAG работают слабо - получается прогрев, а вот наша SEQUOIA - SOTA.
Детали исследования тут https://github.com/Diyago/rag-benchmark/tree/main
Проверенные методы:
No-RAG — Direct LLM generation without retrieval (baseline)
Classical RAG — Dense retrieval (BGE-small + FAISS) -> LLM
Hybrid RAG — BM25 + Dense + RRF fusion + cross-encoder reranker -> LLM
LightRAG — Key-value extraction graph + dense retrieval hybrid
PageIndex — Two-stage hierarchical retrieval
GraphRAG — Entity graph + dense fallback
Agentic RAG — Multi-step reasoning pipeline
SEQUOIA — RAPTOR tree + step-back prompting
SEQUOIA Pro — Multi-query + rerank + compression
Post #218
877

- 🔥 10
- ❤ 3
- 🤯 1