TGViewer
AI.Insaf AI.Insaf @ai_tablet · 1.19K subscribers
Post #218 877
RAG SOTA benchmarks

RAG как инструмент подключения базы знаний и обогащения контекста для LLM - это база. Классический пайплайн обычно включает в себя Hybrid Retrieval с разными фильтрациями (BM25 + семантика + другие способы построения ретривала) и хитрым Context Engineering. Все это заправляется реранкером и сжатием контекста через суммаризацию. Еще можно поработать с самим запросом (Step-back prompting), чтобы помочь ретриверу. Можно также добавить агентности, если много времени (с планнингом, инструментами поиска данных и итеративным ретривером).

В твиттере активно продвигалась история с графовыми RAG и PageIndex как альтернатива векторным базам. Вот как раз lightRAG - хитрая история о том, как собрать базу знаний в граф.

Еще, если поискать, по RAG есть интересная статья - RAPTOR. Как некое развитие графовой истории, это про использование дерева с кластеризацией листьев и последующей суммаризацией самой LLM.

Давайте соберем все это вместе, назовем SEQUOIA (раз уж она про деревья) или Semantic-Evolved QUery-Optimized Iterative Abstraction, сделаем свой бенчмарк и посмотрим, как это выстрелит. Да, LLM будет локальная и немного слабоватая, но все равно на тесты я потратил в сумме более 20 часов работы своей машины.

Результаты ошеломляющие 💃: LlamaIndex и LightRAG работают слабо - получается прогрев, а вот наша SEQUOIA - SOTA.

Детали исследования тут https://github.com/Diyago/rag-benchmark/tree/main

Проверенные методы:

No-RAG — Direct LLM generation without retrieval (baseline)
Classical RAG — Dense retrieval (BGE-small + FAISS) -> LLM
Hybrid RAG — BM25 + Dense + RRF fusion + cross-encoder reranker -> LLM
LightRAG — Key-value extraction graph + dense retrieval hybrid
PageIndex — Two-stage hierarchical retrieval
GraphRAG — Entity graph + dense fallback
Agentic RAG — Multi-step reasoning pipeline
SEQUOIA — RAPTOR tree + step-back prompting
SEQUOIA Pro — Multi-query + rerank + compression
  • 🔥 10
  • ❤ 3
  • 🤯 1
More from @ai_tablet
  1. Sep 29, 2026Хороший друг Никита Зелинский со школой ml inside запускает курс по AI-агентам для продакт…
  2. Sep 21, 2026Agents Trust Tools Too Much (arxiv) Почему-то агенты слишком доверяют вызовам тулов как ед…
  3. Sep 20, 2026Measuring LLM Sycophancy under Sustained Multi-Turn Pressure (arxiv) Сложное название для…
  4. Sep 12, 2026Post #252
  5. Sep 9, 2026MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use (arxiv) Забавная статья, в ко…
  6. Sep 7, 2026Feedback That Backfires arxiv Контринтуитивный вывод в статье. Дефакто в harness-решениях…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →