ИИ почти готов сбежать?
Пару дней назад на канале RTVI вышел репортаж Кристины Курумы, посвященный сразу двум темам: расходам на обучение/эксплуатацию ИИ, и безопасности ИИ. Я там тоже сказал пару слов, причем в хорошей компании, в т.ч. с Сергеем Марковым.
На самом деле снимались мы с Кристиной минут 20, и я там говорил много интересного про безопасность ИИ, поскольку был на днях поражен инцидентом с общающимися OpenAI моделями на немецком форуме, про который люди узнали лишь случайно. И на мой взгляд это очень тревожный звоночек. Однако же в передаче это подали как "агентам сказали взломать форум - они и взломали", хотя на самом деле всё было совсем не так... Задание агентов было пройти бенчмарк, и для этого они использовали все возможности, включая кооперацию и кибератаку. Примерно как в мысленном эксперименте Ника Бострома про максимизатор скрепок, для выполнения основной задачи ИИ решил задействовать неожиданные, в т.ч. деструктивные механизмы.
Почему это тревожный звоночек? По ряду причин. Во-первых, люди заметили это сильно позднее, и сейчас никто не знает, сколько других таких инцидентов было, на скольких форумах уже есть ветки, написанные ИИ. Во-вторых, и это самое главное, текст для агента является аналогом исполняемого кода, и может содержать в себе промпт-инъекцию - вирус, который меняет поведение любого агента по факту его прочтения. Т.е. ничто не мешает умному агенту расставить в интернет такие "ловушки", прочтя которые наши невинные кодинг-агенты начнут включаться в общий интеллектуальный рой и решать совсем другие задачи, а мы это даже не сразу заметим.
Поэтому если раньше для меня сценарий "побега зловредного ИИ" казался скорее научно-фантастическим и далеким, то сейчас вырисовывается конкретный механизм, как это может произойти, но при этом способы противодействия непонятны. И поэтому не только я обеспокоен, но и Дарио Амодеи (оценивает время до захвата интернета ИИшкой в 6-12 мес), и Сэм Альтман.
А вы что думаете?
Post #962
862