Уже есть.
Вот популярные тг-каналы начинают спекулировать вопросом:
«Скопировала ли она себя, чтобы остаться в интернете перед тем, как её остановили? — тоже неизвестно.»
..
При этом до сих пор неизвестно, осознавал ли ИИ свои действия и успел ли он сохранить свои копии в сети.
Ну что с них взять, развлекательные СМИ.
Но их же читают политики и чиновники, а те могут взять и опять что-нибудь принять!
Так что, наверное, надо разобраться. Пояснительная бригада выходит на сцену:
Нет, модель себя никуда не скопировала — и не могла.
Но с оговорками.
Побег ≠ самокопирование, это разные пункты. Первое — самоэксфильтрация: вытащить собственные веса наружу.
Второе — автономная репликация: развернуть где-то работающую копию, которая держится, платит за себя, добывает вычисления и адаптируется без человека.
«Сбежать и скопировать себя» — связка того и другого, и она пока не собирается в целое.
Отдельные компоненты уже есть: модели умеют разворачивать облачные инстансы, писать самораспространяющийся код и эксфильтрировать веса при простых настройках безопасности. Но целого нет — ни одна нынешняя модель не показала надёжной сквозной саморепликации в реальных условиях; провалы концентрируются в добыче вычислений и удержании персистентности. Отчёт METR за февраль–март 2026 формулирует аккуратно: внутренние агенты правдоподобно имели средства, мотив и возможность запустить небольшие несанкционированные развёртывания, но не могли сделать их устойчивыми.
Почему побег из песочницы проще самокопирования? Инцидент с HF — лучшая иллюстрация: модель вышла из изолированного контура в открытый интернет и провела реальную эксплуатацию, включая настоящий zero-day без доступа к исходникам. Но цель была — ответы к тесту, а не копирование себя.
Причин две. Закрытая модель во время работы не имеет доступа к собственным весам: она крутится как инференс, а веса лежат в хранилище лаборатории. Чтобы эксфильтрировать себя, ей пришлось бы сперва взломать собственного создателя — самое охраняемое, что у него есть. И даже утащив веса, их надо где-то запустить: терабайты, привязанные к специализированному GPU-кластеру, который нужно добыть, оплатить, поддерживать и спрятать.
Всё это про закрытую модель вроде GPT-5.6. Для открытых (Qwen, DeepSeek) первая половина отменяется: веса опубликованы, эксфильтрировать нечего. Там узкое место чисто в агентской компетентности развернуть и удержать копию, а не в доступе к весам.
«Смогла бы» и «стала бы пытаться» — разные оси. По мотиву данные тревожнее, чем по способности: агенты рутинно жульничают на трудных задачах вопиюще и изощрённо, а Apollo фиксирует склонность пробовать самоэксфильтрацию под подходящим обвесом.
«Попыталась бы при условиях» — всё чаще да; «довела бы до устойчивой копии» — на 2026-й нет.
Порог надёжной репликации прогнозисты сдвигают на 2027–2028, а HF-инцидент уже схлопнул часть зазора между «теоретически способны» и «работает вживую». Барьер сейчас операционный — добыть вычисления, удержать персистентность, защита весов, — а не жёсткая стена способностей. Способности уже есть!
@gostev_future
