TGViewer
Sber AI Sber AI @sberaiscience · 26.9K subscribers
Post #3508 1.05K
🐲 Факты, графы и никаких галлюцинаций ⛔️

LLM генерируют ответы на основе фактов, но их знания ограничены обучающей выборкой. Чтобы отвечать достоверно на актуальные или узкоспециализированные запросы, модели нужно регулярно дообучать на свежих данных. Здесь на помощь приходят RAG-системы. При генерации ответов они подтягивают релевантные данные из внешних источников или внутренних баз данных.

Но как оценить, насколько хорошо система справляется с этой задачей? Наша команда из SberAI вместе с коллегами из ITMO, МИСИС, ВШЭ и MWS AI разработала DRAGON — первый динамический бенчмарк для оценки RAG-систем на русском языке в сфере новостей.

Как работает DRAGON?
1️⃣ Извлечение фактов из текста
LLM получает новостные статьи из открытых источников и извлекает из них факты в формате триплетов: субъект — отношение — объект. Например, «Россия — нарастила — добычу нефти». Это позволяет превратить неструктурированный текст в формальные логические утверждения

2️⃣ Нормализация сущностей
В тексте встречаются разные формы одного объекта (например, «РФ», «Россия», «Российская Федерация»). Система приводит их к единой форме с учётом контекста, чтобы сделать граф более однородным

3️⃣ Фильтрация
Триплеты, которые уже содержатся в открытых базах знаний (например, Wikidata), удаляются. Это позволяет исключить ситуацию, когда модель «угадывает» ответ, опираясь на обучающие данные, а не на данные из поиска

4️⃣ Построение RDF-графа знаний
Очищенные и нормализованные триплеты объединяются в один граф, отражающий связи между сущностями. Этот граф разбивается на подграфы, каждый из которых используется как основа для генерации вопросов — от простых до логически сложных
Вопросы для тестового набора формируются на основе четырех типов подграфов:
🔘 Simple — по одному факту из триплета
🔘 Set — перечисление связанных сущностей
🔘 Conditional — с логическим условием
🔘 Multi-hop — требует цепочки рассуждений


После того, как подграфы выделены, они передаются в языковую модель, которая с помощью специально подготовленного промпта генерирует вопросно-ответные пары. По ним бенчмарк затем оценивает RAG-системы.

Автогенерация вопросов не гарантирует качества, поэтому финально применяется многоступенчатая фильтрация:
1️⃣ языковая корректность: вопросы проходят проверку моделью, обученной на RuCoLA. Отсеиваются некорректные, неестественные или синтаксически ошибочные формулировки
2️⃣ проверка сущностей: с помощью Natasha извлекаются именованные сущности из статьи. Если они не упоминаются в вопросе или ответе, то пример считается слишком общим и удаляется
3️⃣ проверка на тривиальность: вопросы прогоняются через модели вроде Qwen 2.5 7B и LLaMA 3 8B без контекста. Если они легко угадывают ответ, задача считается тривиальной и исключается
4️⃣ сопоставление с подграфом: упомянутые в вопросе сущности сравниваются с RDF-подграфом (по расстоянию Левенштейна). Отбрасываются примеры без соответствий или с «лишними» сущностями
5️⃣ финальная оценка: отфильтрованные примеры также проходят проверку через POLLUX-7B


🎉 После фильтрации отбираются по 150 лучших вопросов на каждый тип подграфа. Итоговый тест включает только те примеры, что прошли проверку на смысловую связность, сложность и качество.

Бенчмарк защищён от утечек за счёт регулярного обновления тестового датасета и использует извлечение графов знаний из текста для точной работы с фактами.

Репозиторий с кодом на GitHub 💻

🔥 — если прогоните свою модель через DRAGON
  • ❤ 7
  • 🔥 5
  • 👍 2
More from @sberaiscience
  1. Oct 6, 2026Post #4540
  2. Oct 6, 2026ГЕНЕРИРУЙТЕ ВИДЕО СО ЗВУКОМ БЕСПЛАТНО 🔥 Сбер представил новую линейку моделей Kandinsky 6…
  3. Oct 5, 2026ВАМ LLM ИЛИ LLM ПОБЫСТРЕЕ? 🔫 Команда ML-инженера Sber AI Артёма Снегирева выпустила FRIDA…
  4. Oct 5, 2026Post #4535
  5. Oct 5, 2026Post #4534
  6. Oct 5, 2026Post #4533
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →