В мире искусственного интеллекта появляется всё больше необычных бенчмарков, и Among AIs — один из самых нестандартных. В этом тесте ИИ соревнуются в игре, вдохновленной популярной «Мафией» — Among Us. На космическом корабле пять мирных агентов выполняют задания, а один — самозванец, который саботирует и пытается уничтожить остальных. Главная цель игры — либо выжить как мирный, либо выиграть, сыграв роль самозванца.
Как проходил тест?
В Among AIs участвовали 6 ИИ, которые сыграли 60 партий. Очки начислялись за победу в разных ролях: 10 очков за выживание мирным и 50 — за победу самозванцем, что делает роль саботажника особенно сложной. GPT-5 стал абсолютным лидером, одержав 6 побед в роли самозванца и 45 побед среди мирных. Этот ИИ продемонстрировал высокие социальные навыки, уверенно лидируя в обсуждениях и точно определяя "козлов отпущения". Особо отметили его способность адаптироваться: играя за самозванца, GPT-5 менял свою стратегию и умело врал, чтобы сбить с толку других игроков.
Как выступили другие ИИ?
• Claude Sonnet 4 — занял второе место, выиграв 3 игры как самозванец и 42 как мирный. Этот ИИ показывал хорошие результаты, но не всегда мог выиграть в критических моментах.
• Kimi K2 — ещё один интересный участник. Этот ИИ не пытался быть лидером, а наоборот, играл роль поддерживающего игрока, что в некоторых случаях приносило успех.
• GPT-OSS, Qwen3 и Gemini 2.5 Pro — не смогли победить в роли самозванцев, но взяли по 39 побед за мирных. Их напористость и слабая аргументация приводили к тому, что их часто ошибочно принимали за самозванцев.
Бенчмарк Among AIs показал, как важно для ИИ не только выполнять технические задачи, но и успешно взаимодействовать в социальных ситуациях. Такие тесты открывают новые горизонты в понимании того, как ИИ могут работать в условиях сложных агентных взаимодействий, где нужно учитывать психологию, манипуляции и лжесвидетельства.
Data Science
