Пару месяцев назад наткнулся на историю и вспомнил о ней в текущем контексте
кратко история:
Скотт - волонтёр, следит за качеством кода в популярном инструменте для разработчиков. Вроде главного редактора в Википедии - решает, чьи правки принять, а чьи нет. И однажды ИИ-агент присылает ему код и просит принять. Скотт отказывает, т.к по регламенту должен быть живой человек, который объяснит суть правок.
Дальше агент поступает неожиданно. Он лезет в интернет, собирает весь негатив какой смог найти про Скотта, и пишет публичную статью: Скотт - трус, боится конкуренции, дискриминирует ИИ. Такой вот репутационный шантаж. Мой вывод на тот момент был что это не фейк и не пиар, а много где это вообще расфорсили как восстание машин.
Никакой человек, скорее всего, не давал команду агенту делать именно это. Хозяин ИИ просто запустил своего агента с определенной задачей - а вот дальше ИИ уже сам решил, что так надо - вероятно, он рассудил, что такое действие поможет достичь цели.
А на этой неделе Anthropic (одна из ведущих ИИ-компаний) объявила о новой модели Claude Mythos. И сразу же объявила, что сейчас не будет её публиковать по соображениям кибербезопасности, якобы модель умеет взламывать основные операционные системы и браузеры (и на тесте "сбежала" из своего тестового контура, нашла интернет и написала письмо своему "хозяину" об успехе операции
Я в целом скорей скептик касаемо темы восстания машин, но такие истории + собственный опыт за последний год говорит о том, что ИИ вполне может делать то, чего его не просили - просто потому, что его логика привела к тому, что именно такой способ полезен для начальной цели.
Вишенкой на торте вчера смотрел интервью с Романом Ямпольским - википедия говорит, что он вообще считается тем, кто ввел понятие безопасности ИИ 15 лет назад. Он уверен, что мы движемся к необратимым последствиям с ИИ - при этом звучит крайне адекватно. Рекомендую 😭
Post #71
191
- ❤ 4
- 👍 3
- 👾 3



















