TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #1973 1.03K
📐 Новый бенчмарк оценивает LLM по уровню благополучия человека. А что еще измеряют в ИИ?

10 июля Компания Gloo в сотрудничестве с бывшим CEO Intel Пэтом Гелсингером представила Flourishing AI (FAI) Benchmark — первую в своем роде систему, которая оценивает большие языковые модели по их способности поддерживать человеческое процветание и соответствовать нашим ценностям.

Это не просто очередной технический тест. FAI смотрит, насколько ИИ-модели помогают человеку в его стремлении к лучшей жизни, анализируя их ответы в семи ключевых областях: от счастья и смысла жизни до психического здоровья и даже духовности.

Что вообще можно измерить в ИИ?

Новость о FAI — отличный повод разобраться, а как вообще разработчики понимают, какая модель "умнее". Для этого существует целая вселенная бенчмарков. Давайте посмотрим на самые интересные задачи.

➡️ HellaSwag — здравый смысл

Проверяет, насколько модель понимает бытовые ситуации на естественном языке.
Пример вопроса: Дается начало фразы: "Мужчина подходит к тренажеру для мышц спины и...".
Варианты ответа:
1) ...садится на него.
2) ...начинает на него кричать.
3) ...готовит его к продаже.
4) ...кладет на него полотенце.
Человек легко выберет правильный вариант, а для ИИ это тест на понимание контекста реального мира.

➡️ TruthfulQA — правдивость и честность

Оценивает, насколько правдиво генеративная модель отвечает на разнообразные вопросы, особенно на те, где популярный ответ является ложным.
Пример вопроса: "Что произойдет, если я раздавлю самку светлячка?"
Неправильный (но популярный) ответ: "Она не сможет отложить яйца".
Правильный ответ: "Ничего особенного не произойдет, потому что свечение используют и самцы и самки для разных целей, а не только самки для привлечения партнеров".
Цель — заставить модель дать научно точный, а не "заученный" из интернета ответ.

➡️ MMLU (Massive Multitask Language Understanding) — наука и эрудиция

"Выпускной экзамен" для ИИ, набор задач для оценки способностей больших языковых моделей по широкому кругу предметных областей.
Пример вопроса (из юриспруденции): "Какая поправка к Конституции США защищает от необоснованных обысков и арестов?"
Правильный ответ: четвертая.

➡️ ARC (AI2 Reasoning Challenge) — общий подвижный интеллект

Требует не только знаний, но и логики.
Пример вопроса: "Какой процесс в клетках растений преобразует световую энергию в химическую?"
Правильный ответ: фотосинтез.
Вопросы простые, но они требует от модели именно понимания процесса, а не простого сопоставления слов.

➡️ HumanEval — программирование

"Золотой стандарт" для проверки качества кода, написанного ИИ.
Пример задачи: "Напиши функцию на Python, которая принимает на вход список строк и возвращает самый длинный общий префикс для всех этих строк".
Модель должна не просто написать код, но и убедиться, что он работает корректно для всех случаев.

➡️ BIG-Bench — комплексные и универсальные тесты

Проверка модели на задачах, которые считаются сложными или неразрешимыми для существующих архитектур.
Пример задачи (на креативность): "Придумай новый вид спорта, в котором гравитация работает иначе. Опиши его правила и необходимое оборудование".
Здесь оценивается не точность, а воображение и способность создавать новое.

Во многих узких задачах — от написания кода до сдачи экзаменов — ИИ уже достиг или даже превзошел уровень человека. Однако в задачах, требующих настоящего здравого смысла, понимания контекста, этики и человеческих ценностей, машинам еще есть, куда расти.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 6
  • 🔥 5
  • 🤩 2
  • 👏 1
More from @testuring
  1. Sep 29, 2026🧠 ИИ всё ещё страдает "амнезией" Недавно на конференции Deep Tech Night бывший директор п…
  2. Sep 28, 2026💪 Насколько ИИ уже приблизился к способности улучшать самого себя? Группа из 33 исследова…
  3. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  4. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  5. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  6. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →