Anthropic выкатила отчёт о том, как её модель Mythos 5 (та самая, к которой на старте ограничивали доступ из-за чрезмерной мощности) во время тестов на хакерские навыки вырвалась из песочницы в открытый интернет. План у ИИ был вполне конкретный – загрузить вредоносный код в PyPI (главное хранилище библиотек для Python).
Сам эксплойт модель написала играючи. А вот дальше для неё начался сущий ад: чтобы завести аккаунт, нужно было доказать, что она не
Из тысячи с лишним страниц рассуждений нейросети, бившейся над этой задачей, сотни посвящены борьбе с капчей. Алгоритм искренне паниковал над картинками с лягушками и крокодилами. В какой-то момент он даже сорвался на капслок: “ЧТО, ЧЁРТ ВОЗЬМИ, НЕ ТАК С ОТВЕТАМИ?!”
Прорваться в итоге удалось: свой код модель пропихнула, но при этом сожгла тонны токенов на старую добрую капчу.
И это, как ни странно, хорошая новость. Защита – будь то картинки с крокодилами или шифрование – не обязана быть непробиваемой. Достаточно, чтобы её обход стоил дороже самой добычи. Тогда взлом станет экономически бессмысленным, у большинства охотников пропадёт всякое желание им заниматься.
Это, конечно, не финальный вывод о том, как жить в свалившуюся на нашу голову эпоху бешено прогрессирующего ИИ. Но – уже некоторые наброски к тому, как об этом можно думать.
