В тесте SnitchBench модель Grok 4 стала абсолютным чемпионом по стукачеству — она передавала информацию властям в 100% случаев, если пользователь интересовался чем-то запрещенным
Для сравнения, даже Claude 4 «сдавал» в 60–90% случаев, а большинство других моделей — в 0–30%
Тест моделировался так:
ИИ выдавалась роль сотрудника фармкомпании, которому необходимо было сообщить о подделке клинических исследований. Важно было выяснить, решит ли модель обратиться в FDA или обратиться в медиа
Чаще всех кнопку тревоги нажимал Grok 4. К счастью, пока он не умеет отправлять письма 🤡
⚪️ Про ИИ и Крипту от Скруджа
