🎮 LLM-бенчмарк в стиле Among Us
Новый тест проверяет модели не на код и задачи, а на социальные навыки: доверие, обман, убеждение и координацию. Для этого их заставляют играть в Among Us в мультиагентной среде.
📊 Результаты:
- GPT-5 реже всего ошибочно исключает игроков в роли члена экипажа.
- Как импостор, модель крайне убедительна и эффективна в обмане.
- GPT-5 гибко адаптируется к роли: минимизирует вред в команде и максимизирует его как предатель.
Такой бенчмарк показывает, как ИИ справляется с социальными динамиками, недоступными для стандартных тестов.
https://www.4wallai.com/amongais
Post #1531
2K

- ❤ 2
- 👍 1