TGViewer
Открытый код ФКН ВШЭ Открытый код ФКН ВШЭ @hse_cs_opensource · 933 subscribers
Post #185 408
DRAGON

В репозитории опубликован код DRAGOn — методологии и фреймворка для построения RAG-бенчмарков на регулярно обновляемом корпусе. Авторы обращают внимание на проблему статических наборов данных для оценки RAG-систем. Если тестовый корпус долго не меняется, в него постепенно проникает data leakage, а результаты начинают отражать не только качество retrieval и generation, но и то, что модель уже видела похожие тексты при обучении. DRAGOn предлагает более практичную постановку, где бенчмарк живёт вместе с источником данных и регулярно пересобирается на новых документах. В работе это показано на русскоязычном новостном корпусе, но сама схема может быть перенесена и на другие домены, например научные статьи или юридические документы. Ключевая идея DRAGOn состоит в том, чтобы автоматизировать весь цикл оценки. Система регулярно собирает новые тексты, строит по ним граф знаний, генерирует вопросы и ответы с помощью LLM, фильтрует неудачные примеры и публикует новые версии датасета. В итоговый набор входят отдельные коллекции документов, вопросов и скрытых ответов, что позволяет воспроизводимо сравнивать разные RAG-системы на одинаковом материале. Для фильтрации авторы используют несколько этапов проверки, включая контроль грамматичности, проверку соответствия графу знаний и LLM-as-Judge оценку на модели POLLUX 7B. Автоматическая оценка показывает высокую точность по сравнению с ручной проверкой, а после всех этапов отбора в каждую категорию попадает по 150 качественных вопросов. Авторы также запускают открытый leaderboard и показывают, как DRAGOn работает в полноценной экспериментальной схеме. Для retrieval сравниваются FRIDA, Qwen 3Embedding 8B, E5 Mistral 7B Instruct и mE5Large Instruct. Лучшие результаты по Hit Rate и MRR дают Qwen 3Embedding 8B и E5 Mistral 7B Instruct. В end-to-end оценке особенно хорошо себя показывает связка сильного retrieval с instruction LLM, а среди рассмотренных генераторов лучший Judge Score получает Ruadapt Qwen 32B. Отдельно работа показывает, что классические метрики вроде ROUGE-L не всегда достаточно хорошо отражают качество RAG, поэтому оценка по нескольким критериям через LLM-as-Judge здесь оказывается особенно полезной. Работа будет полезна исследователям RAG и разработчикам retrieval-систем.

статья | код
  • 🔥 5
  • 😍 1
More from @hse_cs_opensource
  1. Sep 28, 2026💻 Презентация открытых проектов ФКН Рады сообщить, что 1 октября мы подводим итоги второг…
  2. Sep 25, 2026RL-ABC В репозитории опубликован код RL-ABC — библиотеки на Python для настройки каналов т…
  3. Sep 11, 2026DSCA-HLAII В репозитории опубликован код DSCA-HLAII — модели для предсказания взаимодейств…
  4. Sep 7, 2026Открытый семинар: «Образование после ChatGPT: опенсорс-курс на Физтехе и план развития на…
  5. Aug 21, 2026HairFastGAN В репозитории опубликован код HairFastGAN — метода для быстрого и реалистичног…
  6. Aug 14, 2026GSOFT В репозитории опубликован код GSOFT — метода экономного файнтюнинга нейросетей через…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →