TGViewer
LLM под капотом LLM под капотом @llm_under_hood · 29.3K subscribers
Post #400 8K
Enterprise RAG Challenge - Round 1

Update: сводная табличка с указанием моделей и архитектур - тут.

Вот первые результаты нашего Enterprise RAG Challenge. Максимальное число очков - 100.

Топ победителей:
(1) Daniel Weller - 84
(2) Ilya Rice - 76
(3) Artem Nurmukhametov - 73
(4) Alexandr Bobrov - 71
(5) Anonymous 1337 - 71

Остальные участники следом идут очень плотно по очкам.

Огромное спасибо всем, кто участвовал в тестовом прогоне и деталями! На днях я выложу в открытый доступ в Github данные этого раунда:
(1) ответы всех команд
(2) правильные ответы с комментариями (результат ручной проверки и вычитки PDF)
(3) исходный код алгоритма оценки
(4) рейтинг локальных систем

Вот краткое описание топовых систем:

TTA Daniel - gpt-4o data extraction with structured outputs (bulk checklist), schema-driven question answering over checklist.

Ilya Rice - Langchain RAG with GPT-4o, Text-embedding-3-large and custom chain of thought prompts.

Artem - multi stage checklist - multi-stage checklist with Gemini Flash Experimental.

AlBo - Alexandr Bobrov. Knowledge Graph + Vector Index (Langchain, Neo4j) with GPT-4o

Anonymous 1337 - plain RAG with chunk vectorizer and LLM


Challenge вышел очень необычный - из-за дисбаланса в генераторе вопросов, было очень много вопросов без ответа. На них система должна была сознательно отвечать N/A, что сложно само по себе. Очки показывают, что участвовали системы, в которые вложили заметные усилия для обхода галлюцинаций.

В осеннем раунде я устраню этот дисбаланс и добавлю больше вариаций в генератор вопросов. Это усложнит жизнь системам на базе knowledge mapping.

Как вам этот Challenge, поделитесь впечатлениями?

Вaш, @llm_under_hood 🤗
  • ❤ 44
  • 🔥 36
  • 👏 13
  • 👍 6
  • 🤩 4
More from @llm_under_hood
  1. Sep 25, 2026Семь месяцев работы с Codex-ом в одном графике Это иллюстрация из моего поста про последни…
  2. Sep 24, 2026Период полураспада софта - 3 месяца Я сейчас возвращаюсь к сайту BitGN, чтобы начать подго…
  3. Sep 23, 2026Post #947
  4. Sep 22, 2026GPT-6 Sol и Luna - бенчмарк цены, качества и скорости А еще Opus 5.5 и Astra 6 (medium). В…
  5. Sep 22, 2026Доклад про DDD + AI в проектах (Berlin, 2025, EN) Не прошло и года с прошлого KanDDDinsky,…
  6. Sep 22, 2026LLM Benchmark Jev - топ для простых задач Jev - это новая LLM модель, в которую встроили S…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →