TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1660 1.97K
⚡️ Google DeepMind представила FACTS Benchmark - новый набор тестов для оценки фактической точности LLM.

Коротко:
- DeepMind и Kaggle запустили FACTS Benchmark Suite для системного измерения фактической точности моделей в разных режимах.
- В набор входят 4 направления:
• Parametric - проверка внутреннего знания модели
• Search - ответы с использованием веб-поиска
• Multimodal - вопросы на основе изображений
• Grounding v2 - ответы на основе предоставленного контекста

- Всего 3 513 примеров; часть данных скрыта и используется только для официальной оценки и лидерборда.
- Топовые модели прошли тестирование: Gemini 3 Pro показывает лучший общий результат - 68.8% FACTS Score, значительно опередив Gemini 2.5 Pro, особенно в задачах Search и Parametric.
- Самой сложной областью остаётся мультимодальная фактуальность - ни одна модель не превысила порог в 70%, что показывает, насколько далеко ещё можно улучшать точность.

Новый бенчмарк даёт более реалистичную картину того, как модели справляются с фактами в разных режимах и насколько они надёжны в реальном использовании.

https://deepmind.google/blog/facts-benchmark-suite-systematically-evaluating-the-factuality-of-large-language-models
  • ❤ 3
More from @bigdatai
  1. Sep 27, 2026ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теп…
  2. Sep 24, 2026🧹 Opus 5.5 пора избавить от «магии промптов» Разработчик Anthropic поделился полезным при…
  3. Sep 24, 2026LLM умер, да здравствует LLM Главный сдвиг последних месяцев — модели перестают быть прост…
  4. Sep 23, 2026photo post
  5. Sep 23, 2026✔️ OpenAI начала работать с независимым советом математиков Компания будет советоваться с…
  6. Sep 22, 2026WebCraftBench проверяет сайты, созданные ИИ Агент говорит, что сайт готов. Но главная стра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →