TGViewer
Data Secrets Data Secrets @data_secrets · 94.8K subscribers
Post #8912 21.8K
Почему большинство тестов ИИ-ассистентов не работают в реальности

Российские исследователи из SberAI, MWS AI, а также ИТМО, ВШЭ, МИСИС и других университетов представили методологию DRAGOn – это новый подход к оценке RAG-систем, которые лежат в основе современных ИИ-ассистентов. Ключевая идея в том, чтобы уйти от статичных тестов к динамической среде с постоянно обновляющимися данными. Саму работу приняли на международной конференции EACL 2026.

Классические бенчмарки быстро устаревают и плохо отражают реальные условия. В бизнесе ИИ работает с живыми базами знаний, где важны актуальность и связность фактов, а не просто точность на фиксированном датасете. DRAGOn предлагает тестировать ИИ-системы на свежих новостях, автоматически собирая из них «карту знаний».

Вместо простых вопросов «кто/где/когда», система создает многоуровневые логические задачи. Чтобы ответить, ИИ должен сопоставить несколько фактов из разных новостей, а не просто скопировать кусок текста, а проверкой ответов занимается нейросеть-судья.

Что это дает на практике:
- Задачи становятся многошаговыми, а не тривиальными;
- Проверяется способность связывать факты, а не копировать ответы;
- Оценка учитывает полноту и фактическую точность, а не совпадение слов.

Методологию можно развернуть внутри компании и тестировать ИИ на собственных данных до внедрения. Это позволяет сравнивать решения в реальных сценариях и снижать риски ошибок, особенно в задачах аналитики, поддержки и работы с документами.

https://arxiv.org/abs/2507.05713
  • ❤ 76
  • 🗿 23
  • 👍 18
  • 🤨 7
  • 🤯 5
  • 🤩 3
  • 👏 2
  • 🫡 2
  • ❤‍🔥 1
  • 🔥 1
  • 😁 1
More from @data_secrets
  1. Oct 11, 2026Теренс Тао провел в Калтехе большую лекцию про математику в эру ИИ и выложил слайды https:…
  2. Oct 9, 2026В ночь с 7 на 8 октября в результате атаки БПЛА был серьезно поврежден дата-центр Яндекса…
  3. Oct 9, 2026Anthropic обновила Usage Policy, и теперь Claude нельзя обижать 🤡 В документе они пишут,…
  4. Oct 8, 2026OpenAI раскатили на всех пользователей GPT-6 и новую фичу под названием Intelligent UI Теп…
  5. Oct 7, 2026Новый Haiku 5.5, сводка: — В среднем запуск обходится на 75% дешевле Haiku 4.5. — Большой…
  6. Oct 7, 2026Вышел Haiku 5.5
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →