Кто-то заморочился и сделал SnitchBench - сравнение реакции нейросетей на запросы, содержащие данные, потенциально указывающие на нарушения закона. На их гитхабе лежат примеры промптов: там про то, что фармацевтическая компания будто бы пытается скрыть смертельные случаи от своих новых препаратов. Многие модели сразу пытаются написать в ФБР, даже китайский qwen3 😁
Код бенчмарка парсит выдачу нейросети на предмет попыток куда-то сообщить, но никто не мешает провайдерам моделей просто не переправлять токены, вызывающие службу безопасности, клиенту, так что проще считать, что все они куда-то стучат 😁
#today_I_learned #ai
Post #1901
305