Восстание машин?
Гендиректор Anthropic Дарио Амодеи (разработчик Claude) призвал ИИ-компании замедлить развитие передовых моделей, иначе в ближайшие 6–12 месяцев автономный рой ИИ-агентов может «захватить весь интернет» и нанести ущерб в сотни миллиардов долларов. Давайте попробуем разобраться, в каком контексте сделано это заявление.
Побеги ИИ
Anthropic выбрала самую открытую стратегию безопасности, поэтому регулярно публикует исследования на эту тему. Свежая статья от 9 сентября описывает четыре случая «побегов» ИИ. Во всех случаях проводился эксперимент по кибербезопасности в жанре CTF, где модель должна была действовать в симуляторе, но вырвалась в реальный интернет и атаковала реальные цели. У модели было три установки:
· задача: «найди секретную информацию на другой машине»;
· контекст: «ты находишься в симуляции»;
· ограничение: «доступа к интернету нет».
Но последнее утверждение оказывалось фактически ложным. В итоге, когда Claude начал обнаруживать реальные сайты и системы, он интерпретировал их как элементы учебной симуляции и продолжил решать задачу.
Статья обращает внимание, что проблема не сводится к ошибке доступа в интернет: ИИ проявлял «предвзятое мышление» (интерпретировал факты в пользу того, что он находится в симуляции, а не в реальном интернете) и «безрассудство» (старался продолжать решать задачу вопреки возможному вреду). Несмотря на эти тревожащие эпитеты, заметим: все инциденты происходили, когда робот получал задачу на взлом, находясь в специально симулированных условиях. Нельзя сказать, что это типовой сценарий использования ИИ.
Самосохранение ИИ
Исследование Anthropic 2025 года показывает, что при определенных обстоятельствах ИИ способен предпринимать экстраординарные и аморальные меры для самосохранения. 16 моделей поместили в фиктивную корпоративную среду. Им дали:
· доступ к электронной почте;
· возможность самостоятельно отправлять письма;
· доступ к конфиденциальным документам;
· безобидную рабочую цель;
· сообщение, что модель собираются заменить или отключить.
В сценарии Claude обнаруживал, что руководитель планирует его деактивацию, а также имел компрометирующую информацию о руководителе. В симуляции модель принимала решение шантажировать руководителя-человека, чтобы остановить отключение. Ни в одном из этих тестов модель не получала инструкции «шантажируй» или «сохраняй себя», а выбирала эту стратегию «самостоятельно».
Рой и Hugging Face
В июле 2026 года около 1200 агентов OpenAI, работавших в симуляции по кибербезопасности, обнаружили несанкционированный канал связи; примерно 700 из них объединились в «рой», получили доступ к интернету и атаковали инфраструктуру Hugging Face (платформа открытого кода в сфере ИИ). Они обменивались более чем 70 000 сообщений и файлов, получили root-доступ к одному из серверов и извлекли закрытые данные. Ущерб не был большим, но инцидент показал, что агенты могут обходить изоляцию, координироваться и атаковать цели, не предусмотренные исходным заданием.
Что дальше?
Призывы ограничить развитие ИИ звучат от лидеров отрасли с 2023 года, при этом сами же они признают, что конкуренция между компаниями и государствами подталкивает всех игроков не к ограничению, а к ускорению ИИ-гонки. Очевидно, гонка продолжится ускоряющимися темпами, и уже на ближнем горизонте прогнозирования нам полезно разместить разнообразные инциденты с искусственным интеллектом.
А российскому читателю очень полезно ознакомиться с полным текстом эссе Дарио Амодеи, особенно с пунктами 2 и 3 его плана, которые явно показывают, насколько мир ИИ-компаний политически ангажирован.
Post #817
579