DRAGON
В репозитории опубликован код DRAGOn — методологии и фреймворка для построения RAG-бенчмарков на регулярно обновляемом корпусе. Авторы обращают внимание на проблему статических наборов данных для оценки RAG-систем. Если тестовый корпус долго не меняется, в него постепенно проникает data leakage, а результаты начинают отражать не только качество retrieval и generation, но и то, что модель уже видела похожие тексты при обучении. DRAGOn предлагает более практичную постановку, где бенчмарк живёт вместе с источником данных и регулярно пересобирается на новых документах. В работе это показано на русскоязычном новостном корпусе, но сама схема может быть перенесена и на другие домены, например научные статьи или юридические документы. Ключевая идея DRAGOn состоит в том, чтобы автоматизировать весь цикл оценки. Система регулярно собирает новые тексты, строит по ним граф знаний, генерирует вопросы и ответы с помощью LLM, фильтрует неудачные примеры и публикует новые версии датасета. В итоговый набор входят отдельные коллекции документов, вопросов и скрытых ответов, что позволяет воспроизводимо сравнивать разные RAG-системы на одинаковом материале. Для фильтрации авторы используют несколько этапов проверки, включая контроль грамматичности, проверку соответствия графу знаний и LLM-as-Judge оценку на модели POLLUX 7B. Автоматическая оценка показывает высокую точность по сравнению с ручной проверкой, а после всех этапов отбора в каждую категорию попадает по 150 качественных вопросов. Авторы также запускают открытый leaderboard и показывают, как DRAGOn работает в полноценной экспериментальной схеме. Для retrieval сравниваются FRIDA, Qwen 3Embedding 8B, E5 Mistral 7B Instruct и mE5Large Instruct. Лучшие результаты по Hit Rate и MRR дают Qwen 3Embedding 8B и E5 Mistral 7B Instruct. В end-to-end оценке особенно хорошо себя показывает связка сильного retrieval с instruction LLM, а среди рассмотренных генераторов лучший Judge Score получает Ruadapt Qwen 32B. Отдельно работа показывает, что классические метрики вроде ROUGE-L не всегда достаточно хорошо отражают качество RAG, поэтому оценка по нескольким критериям через LLM-as-Judge здесь оказывается особенно полезной. Работа будет полезна исследователям RAG и разработчикам retrieval-систем.
статья | код
Post #185
408

- 🔥 5
- 😍 1