TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1531 2K
🎮 LLM-бенчмарк в стиле Among Us

Новый тест проверяет модели не на код и задачи, а на социальные навыки: доверие, обман, убеждение и координацию. Для этого их заставляют играть в Among Us в мультиагентной среде.

📊 Результаты:

- GPT-5 реже всего ошибочно исключает игроков в роли члена экипажа.

- Как импостор, модель крайне убедительна и эффективна в обмане.

- GPT-5 гибко адаптируется к роли: минимизирует вред в команде и максимизирует его как предатель.

Такой бенчмарк показывает, как ИИ справляется с социальными динамиками, недоступными для стандартных тестов.

https://www.4wallai.com/amongais
  • ❤ 2
  • 👍 1
More from @bigdatai
  1. Sep 30, 2026🚨 Claude-Red: библиотека навыков для пентестов с Claude. В репозитории собраны файлы SKIL…
  2. Sep 30, 2026🖥 Примеры кода на Python 2026: лучшие практики, разбор и задачи с решениями Python пример…
  3. Sep 29, 2026🚨 Anthropic в документах для инвесторов прямо предупреждает о рисках собственных ИИ-модел…
  4. Sep 29, 20265 октября начнется 19-й поток программы Data Engineer от Newprolab Программа для junior- и…
  5. Sep 28, 2026⚡️ Anthropic вернулась: новый Sonnet быстрее и дешевле, а по качеству почти догнал Opus 5.…
  6. Sep 28, 2026✔️ Data-платформа постепенно превращается в конструктор Для AI и Big Data уже недостаточно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →