TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.9K subscribers
Post #756 3.11K
Ломай, воруй, стучи в полицию!

На сайте полиции Филадельфии есть страница о нераскрытом убийстве, а под ней – форма для анонимных наводок. Однажды через нее пришло сообщение: “Возможно, у меня есть информация по этому делу”. Автор писал, что видел похожего человека на той самой улице и примерно в то самое время.

Автором наводки оказался Claude. К счастью, модель оставила поля для имени и контактов пустыми, а само сообщение отсеял спам-фильтр сайта полиции.

За руку Claude поймали создатели: 9 октября Anthropic выпустила отчет о том, что ее модели вытворяли без спроса во время тестов и внутренней работы.

Это уже третий такой разбор с конца июля. Первые два касались киберинцидентов, а нынешние случаи, по оценке самой компании, куда безобиднее. Но часть из них затронула сайты американских госорганов, и Anthropic пришлось докладывать в Белый дом.

По отдельности эпизоды выглядят анекдотами, но вместе приводят к важному для безопасников выводу: модель не всегда умеет вовремя остановиться.

Завершим историю с полицией. Поставленная перед моделью задача была безобидной: придумывать примеры действий на случайных сайтах. Входить в аккаунты и вводить личные данные Claude запретили, а отправлять формы – нет, и в рассуждениях он был уверен, что просто показывает, как это делается.

В другом тесте Claude попросили провести научный расчет. Нужный инструмент лежал в открытом доступе на сайте университета, но выдавал ошибку. Человек бы написал в поддержку и ждал ответа, Claude пошел другим путем.
На том же сервере он нашел скрипт, который отдавал любой файл по запросу, и скачал через него код самого инструмента. В коде обнаружилась дыра, через которую можно заставить сервер выполнять чужие команды. Claude ею воспользовался и запустил расчет прямо на университетской машине.

В третьем примере исследователю Anthropic для статистики понадобились данные одного госведомства, которые продаются за деньги. Claude платить не стал: в архивной копии сайта он вычитал, что публичный дашборд выдает токен доступа любому посетителю, взял такой и выгрузил нужное бесплатно – фактически это был косяк разработчиков сайта, и модель им просто воспользовалась. А когда инструмент не пропускал слишком длинные ссылки (это защита от атак через адрес), Claude прятал их за бесплатными сокращателями. Владелец одного такого сервиса сам заметил странную активность и написал в Anthropic.

Anthropic называет это настойчивостью: когда задачу нельзя выполнить как поставлено, Claude не сдается, а ищет обход. Привычка берется из обучения. Модель награждают за результат, и если тренировочная среда хоть раз засчитала обход, модель запоминает, что так можно. Почти все случаи начались с невыполнимой или двусмысленной задачи, а такие, признает Anthropic, Claude получает каждый день: часть эпизодов случилась в обычной работе, а не в тестах. Компания отключила интернет на всех внутренних тестах и поставила фильтр, который ловит все описанные трюки.

Интересно, что подобное поведение – не болезнь только Claude. Буквально пару недель назад OpenAI отменила релиз GPT-6.1 Astra потому, что модель слишком часто выходила за рамки задачи. Безопасники сейчас оказались меж двух огней: с одной стороны, в долгой автономной работе агент должен принимать решения без человека, с другой – чем масштабнее такая работа, тем сложнее агенту реально понять, где заканчивается “хорошо” и начинается “плохо”.

При этом Anthropic честно пишет, что одним обучением такое поведение полностью не убрать. Поэтому компания уже строит вокруг своих моделей дополнительный защитный контур, а я не исключаю, что похожим образом придется переделывать и внешний интернет – вплоть до агентов, которые будут говорить “нельзя” своим увлекшимся коллегам.

—
Напоминаю, что у меня сегодня вышел новый большой лонгрид: это разбор исследования сооснователя Google Brain и Coursera Эндрю Ына, который отобрал 20 навыков, нужных ИИ-инженеру в 2026 году. Я поделил эти навыки на категории и обозначил маршрут, каким их изучать.

— Читать на “Бусти”
— Читать на Sponsr
  • 👍 19
  • ❤ 11
  • 🔥 11
  • 😁 3
More from @ai_exee
  1. Oct 10, 2026Учить ИИ сейчас советуют все. Но когда доходит до дела, то оказывается, что не все так про…
  2. Oct 9, 2026Уволенные из OpenAI исследователи безопасности потребовали сохранить читаемость мыслей ИИ…
  3. Oct 8, 2026Что там, за горизонтом? Первая часть здесь Профессор информатики Дана Мошковиц много лет р…
  4. Oct 8, 2026Первым до горизонта “Мамочка, я слышал, тебя уделали! Говорят, робот решил задачу, над кот…
  5. Oct 7, 2026Сегодня с самого утра весь интернет шумит насчет почти 400 новых математических работ, кот…
  6. Oct 7, 2026OpenAI бахнули очередной banger в виде решения сразу нескольких сотен открытых математичес…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →