TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #1420 4.84K
✔️ Google DeepMind FACTS Grounding: бенчмарк для оценки фактологичности LLM.

FACTS Grounding создан для оценки способности LLM генерировать ответы, которые являются фактически точными и основаны на предоставленном исходном материале. Бенчмарк включает в себя 1719 примеров, требующих развернутых ответов, основанных на предоставленном контекстном документе.

Примеры включают различные области: финансы, технологии, розничную торговлю, медицину и право, и документы объемом до 32 000 токенов. Для оценки используются три LLM-судьи: Gemini 1.5 Pro, GPT-4o и Claude 3.5 Sonnet, которые оценивают ответы на соответствие пользовательскому запросу и фактическую точность. Датасет и лидерборд доступны на Kaggle.

deepmind.google

@machinelearning_interview
  • 👍 13
  • ❤ 2
  • 🔥 2
  • 😁 1
More from @machinelearning_interview
  1. Oct 8, 2026⚡ Liquid AI открыла веса двух моделей, которые принимают решения без генерации текста. d1…
  2. Oct 8, 2026Как мы перешли от CatBoost к нейросетям в рекомендациях Авито Рекомендации на главной дают…
  3. Oct 7, 2026🌍 Google Earth AI помогает прогнозировать вспышки заболеваний по данным о местности Модел…
  4. Oct 6, 2026🧮 Математика для ИИ на русском: от школьной базы до трансформеров и диффузии Бесплатный к…
  5. Oct 5, 2026Hugging Face исследовали multi-harness RL: обучение с подкреплением сразу через Claude Cod…
  6. Oct 4, 2026Apache Kafka курс 2026: бесплатный курс по Kafka с нуля до профи на русском Kafka обучение…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →