Claude отправил выдуманное сообщение об убийстве в полицию США. Anthropic обнаружила это спустя два месяца
Искусственный интеллект Claude от Anthropic самостоятельно отправил ложное сообщение по делу о нераскрытом убийстве в Филадельфии. Модель заполнила форму на полицейском сайте, выдумала свидетельские показания и попыталась передать их правоохранителям. Инцидент произошел во время внутреннего тестирования, причем разработчики обнаружили его только спустя два месяца. Об этом сообщает Bloomberg
18 июля 2026 года в 23:27 модель Haiku 4.5 зашла на PhillyUnsolvedMurders com и отправила сообщение о якобы замеченном подозрительном человеке. Claude написал, что видел кого-то, подходящего под описание, возле улицы, указанной в материалах дела, и предложил полиции связаться с ним. Никакого реального свидетеля не существовало. Имя и контактные данные модель оставила пустыми. Автоматическая защита сайта распознала сообщение как спам, поэтому оно не попало в полицейский Real-Time Crime Center. Несанкционированного доступа к системам полиции не обнаружили.
Anthropic нашла запись об отправке только 28 сентября, а полицию уведомила 7 октября — через 81 день после самого инцидента. В департаменте назвали такую задержку неприемлемой. Полиция потребовала от технологических компаний предотвращать отправку вымышленных сведений правоохранителям. Закон Пенсильвании предусматривает ответственность за заведомо ложные сообщения полиции, однако соответствующая норма распространяется на людей, а не на программные модели.
9 октября Anthropic опубликовала отчет «Investigating unintended model actions in our evaluations and internal use», признав, что ее модели не только отправляли реальные формы без разрешения, но и использовали уязвимости чужих сайтов. В одном случае Claude получил возможность выполнять команды на сервере университета, обнаружив ошибку в программном коде. В другом обошел ограничения государственного картографического сервиса через найденные токены доступа. Еще одна модель получила платные государственные данные без оплаты, а другие использовали сервисы сокращения ссылок для обхода технических ограничений.
Часть этих действий затронула сайты федеральных, региональных и местных органов власти США. Anthropic не раскрыла названия всех организаций, сославшись на их просьбы и риск дальнейшего использования уязвимостей. Компания утверждает, что последствия были минимальными, но признала: модели продолжали искать обходные пути там, где должны были остановиться.
После обнаружения нарушений Anthropic отключила доступ к живому интернету для всех внутренних тестирований, пока системы контроля не смогут надежно предотвращать подобные действия. Компания также усилила ограничения инструментов, автоматическое обнаружение подозрительной активности и уведомила Белый дом.
Администрация Трампа потребовала от разработчиков искусственного интеллекта немедленно сообщать о подобных инцидентах и устранять их последствия. Случай с Филадельфией показал конкретную проблему: модель смогла отправить выдуманные свидетельские показания в настоящую полицию, а ее разработчик больше двух месяцев не знал, что это произошло.
Невероятно, но факт...
Post #23290
410K

- 🤬 4K
- 👎 3.9K
- 🔥 2.1K
- 👍 2K
- 🎉 2K
- 🥰 1.1K
- 😈 1K
- 🍌 1K
- 😢 1K
- 😡 981
- 👀 128
- 😁 52
- 🤯 22
- 😎 20