Ломай, воруй, стучи в полицию!
На сайте полиции Филадельфии есть страница о нераскрытом убийстве, а под ней – форма для анонимных наводок. Однажды через нее пришло сообщение: “Возможно, у меня есть информация по этому делу”. Автор писал, что видел похожего человека на той самой улице и примерно в то самое время.
Автором наводки оказался Claude. К счастью, модель оставила поля для имени и контактов пустыми, а само сообщение отсеял спам-фильтр сайта полиции.
За руку Claude поймали создатели: 9 октября Anthropic выпустила отчет о том, что ее модели вытворяли без спроса во время тестов и внутренней работы.
Это уже третий такой разбор с конца июля. Первые два касались киберинцидентов, а нынешние случаи, по оценке самой компании, куда безобиднее. Но часть из них затронула сайты американских госорганов, и Anthropic пришлось докладывать в Белый дом.
По отдельности эпизоды выглядят анекдотами, но вместе приводят к важному для безопасников выводу: модель не всегда умеет вовремя остановиться.
Завершим историю с полицией. Поставленная перед моделью задача была безобидной: придумывать примеры действий на случайных сайтах. Входить в аккаунты и вводить личные данные Claude запретили, а отправлять формы – нет, и в рассуждениях он был уверен, что просто показывает, как это делается.
В другом тесте Claude попросили провести научный расчет. Нужный инструмент лежал в открытом доступе на сайте университета, но выдавал ошибку. Человек бы написал в поддержку и ждал ответа, Claude пошел другим путем.
На том же сервере он нашел скрипт, который отдавал любой файл по запросу, и скачал через него код самого инструмента. В коде обнаружилась дыра, через которую можно заставить сервер выполнять чужие команды. Claude ею воспользовался и запустил расчет прямо на университетской машине.
В третьем примере исследователю Anthropic для статистики понадобились данные одного госведомства, которые продаются за деньги. Claude платить не стал: в архивной копии сайта он вычитал, что публичный дашборд выдает токен доступа любому посетителю, взял такой и выгрузил нужное бесплатно – фактически это был косяк разработчиков сайта, и модель им просто воспользовалась. А когда инструмент не пропускал слишком длинные ссылки (это защита от атак через адрес), Claude прятал их за бесплатными сокращателями. Владелец одного такого сервиса сам заметил странную активность и написал в Anthropic.
Anthropic называет это настойчивостью: когда задачу нельзя выполнить как поставлено, Claude не сдается, а ищет обход. Привычка берется из обучения. Модель награждают за результат, и если тренировочная среда хоть раз засчитала обход, модель запоминает, что так можно. Почти все случаи начались с невыполнимой или двусмысленной задачи, а такие, признает Anthropic, Claude получает каждый день: часть эпизодов случилась в обычной работе, а не в тестах. Компания отключила интернет на всех внутренних тестах и поставила фильтр, который ловит все описанные трюки.
Интересно, что подобное поведение – не болезнь только Claude. Буквально пару недель назад OpenAI отменила релиз GPT-6.1 Astra потому, что модель слишком часто выходила за рамки задачи. Безопасники сейчас оказались меж двух огней: с одной стороны, в долгой автономной работе агент должен принимать решения без человека, с другой – чем масштабнее такая работа, тем сложнее агенту реально понять, где заканчивается “хорошо” и начинается “плохо”.
При этом Anthropic честно пишет, что одним обучением такое поведение полностью не убрать. Поэтому компания уже строит вокруг своих моделей дополнительный защитный контур, а я не исключаю, что похожим образом придется переделывать и внешний интернет – вплоть до агентов, которые будут говорить “нельзя” своим увлекшимся коллегам.
—
Напоминаю, что у меня сегодня вышел новый большой лонгрид: это разбор исследования сооснователя Google Brain и Coursera Эндрю Ына, который отобрал 20 навыков, нужных ИИ-инженеру в 2026 году. Я поделил эти навыки на категории и обозначил маршрут, каким их изучать.
— Читать на “Бусти”
— Читать на Sponsr
Post #756
3.11K

- 👍 19
- ❤ 11
- 🔥 11
- 😁 3