"Это бенчмарк для оценки знаний и галюцинаций, который поощряет точность, наказывает за неверные предположения и предоставляет всесторонний обзор того, какие модели выдают фактически достоверные результаты в различных областях."
Честно говоря, точность ответов и широта галлюцинаций чатботов несколько удручают.

