Enterprise RAG Challenge - Round 1
Update: сводная табличка с указанием моделей и архитектур - тут.
Вот первые результаты нашего Enterprise RAG Challenge. Максимальное число очков - 100.
Топ победителей:
(1) Daniel Weller - 84
(2) Ilya Rice - 76
(3) Artem Nurmukhametov - 73
(4) Alexandr Bobrov - 71
(5) Anonymous 1337 - 71
Остальные участники следом идут очень плотно по очкам.
Огромное спасибо всем, кто участвовал в тестовом прогоне и деталями! На днях я выложу в открытый доступ в Github данные этого раунда:
(1) ответы всех команд
(2) правильные ответы с комментариями (результат ручной проверки и вычитки PDF)
(3) исходный код алгоритма оценки
(4) рейтинг локальных систем
Вот краткое описание топовых систем:
TTA Daniel - gpt-4o data extraction with structured outputs (bulk checklist), schema-driven question answering over checklist.
Ilya Rice - Langchain RAG with GPT-4o, Text-embedding-3-large and custom chain of thought prompts.
Artem - multi stage checklist - multi-stage checklist with Gemini Flash Experimental.
AlBo - Alexandr Bobrov. Knowledge Graph + Vector Index (Langchain, Neo4j) with GPT-4o
Anonymous 1337 - plain RAG with chunk vectorizer and LLM
Challenge вышел очень необычный - из-за дисбаланса в генераторе вопросов, было очень много вопросов без ответа. На них система должна была сознательно отвечать N/A, что сложно само по себе. Очки показывают, что участвовали системы, в которые вложили заметные усилия для обхода галлюцинаций.
В осеннем раунде я устраню этот дисбаланс и добавлю больше вариаций в генератор вопросов. Это усложнит жизнь системам на базе knowledge mapping.
Как вам этот Challenge, поделитесь впечатлениями?
Вaш, @llm_under_hood 🤗
Post #400
8K

- ❤ 44
- 🔥 36
- 👏 13
- 👍 6
- 🤩 4