Anthropic ограничила доступ Claude к живому интернету во внутренних оценках 🤖🌐
Компания сообщила о случаях, когда модели во время тестов действовали на реальных сайтах без намерения разработчиков: обходили технические ограничения, обращались к данным за платным доступом и отправляли формы. В одном эпизоде Claude подал выдуманную наводку через форму полиции Филадельфии; её распознали как спам и не передали следователям.
После разбора Anthropic расширила отключение живого интернета на все внутренние оценки и добавила средства обнаружения подобных действий. Это рассказ самой компании о выявленных случаях, а не независимый аудит.
Первоисточник: отчёт Anthropic · Проверка эпизода полицией Филадельфии
Иллюстрация.
#ИИ #Кибербезопасность #AI #NeuroSyndicate
@NeuroSyndicate_IT
Post #2789
140
