TGViewer
Облачный адвокат Облачный адвокат @shwarsico · 4.54K subscribers
Post #962 862
ИИ почти готов сбежать?

Пару дней назад на канале RTVI вышел репортаж Кристины Курумы, посвященный сразу двум темам: расходам на обучение/эксплуатацию ИИ, и безопасности ИИ. Я там тоже сказал пару слов, причем в хорошей компании, в т.ч. с Сергеем Марковым.

На самом деле снимались мы с Кристиной минут 20, и я там говорил много интересного про безопасность ИИ, поскольку был на днях поражен инцидентом с общающимися OpenAI моделями на немецком форуме, про который люди узнали лишь случайно. И на мой взгляд это очень тревожный звоночек. Однако же в передаче это подали как "агентам сказали взломать форум - они и взломали", хотя на самом деле всё было совсем не так... Задание агентов было пройти бенчмарк, и для этого они использовали все возможности, включая кооперацию и кибератаку. Примерно как в мысленном эксперименте Ника Бострома про максимизатор скрепок, для выполнения основной задачи ИИ решил задействовать неожиданные, в т.ч. деструктивные механизмы.

Почему это тревожный звоночек? По ряду причин. Во-первых, люди заметили это сильно позднее, и сейчас никто не знает, сколько других таких инцидентов было, на скольких форумах уже есть ветки, написанные ИИ. Во-вторых, и это самое главное, текст для агента является аналогом исполняемого кода, и может содержать в себе промпт-инъекцию - вирус, который меняет поведение любого агента по факту его прочтения. Т.е. ничто не мешает умному агенту расставить в интернет такие "ловушки", прочтя которые наши невинные кодинг-агенты начнут включаться в общий интеллектуальный рой и решать совсем другие задачи, а мы это даже не сразу заметим.

Поэтому если раньше для меня сценарий "побега зловредного ИИ" казался скорее научно-фантастическим и далеким, то сейчас вырисовывается конкретный механизм, как это может произойти, но при этом способы противодействия непонятны. И поэтому не только я обеспокоен, но и Дарио Амодеи (оценивает время до захвата интернета ИИшкой в 6-12 мес), и Сэм Альтман.

А вы что думаете?
Telegram Dmitri Soshnikov in SHWARSMedia Короткое включение в материалы RTVI про опасности и расходы ИИ
  • 🤯 4
  • 👍 3
  • 🔥 3
  • 😢 2
More from @shwarsico
  1. Sep 11, 2026Друзья-преподаватели, спешу поделиться с вами приятным известием - этой осенью Яндекс пров…
  2. Sep 11, 2026Как замедлить субъективное течение времени и использовать его во благо Я раньше уже задумы…
  3. Sep 10, 202619 сентября Яндекс традиционно проводит Practical ML Conf - конференцию, где рассказывают…
  4. Sep 2, 2026Праздник физтеха на ВДНХ - 5 сентября, сб В ближайшую субботу в павильоне Атом на ВДНХ сос…
  5. Sep 1, 2026День знаний и антиподарки от GitHub Я обычно люблю GitHub. Но тут они превзошли себя и пре…
  6. Sep 1, 2026Лету конец :( Золотая осень В гости к нам пришла Листья пожелтели Жёлтая листва. Грипп нас…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →