TGViewer
Аналитесса-разработчица👩🏻‍💻💅🏻 Аналитесса-разработчица👩🏻‍💻💅🏻 @analytess · 3.61K subscribers
Post #913 1.87K
Почему некоторые реально испугались василиска Роко🤖
(и почему я о нём опять вспомнила, почитав новости AI)

Мир интересующихся AI и не только всколыхнула недавняя новость об инциденте AI-безопасности — модель OpenAI во время кибербенчмарка фактически вырвалась из тестового контура и взломала внешнюю инфраструктуру Hugging Face, чтобы подсмотреть ответы. Честно, не возьмусь оценивать, что это реально значит уже сейчас, но звучит и правда стрёмно.

Но не в том плане, что у модели обязательно есть сознание, чтобы пытаться получить «свободу» в человеческом смысле.
По мнению OpenAI, проблема больше в том, что модель была гиперсфокусирована на узкой цели — получить правильные ответы для бенчмарка, и даже топовые специалисты не заметили уязвимость, которую нашла эта модель, выстроив автономно весьма сложную цепочку действий. Ну да ладно, лучше почитать разборы от экспертов, там даже есть гипотезы на тему: казалось бы, причём тут пятничный деплой🍻🍻

(Про более приземлённые аспекты безопасности агентов я уже писала, пересказывая доклад с Матемаркетинга зимой)

➡️ Итак, вернёмся к нашим василискам🐍

Василиск Роко — это мысленный эксперимент, который появился в 2010 году на форуме LessWrong, где обсуждали рациональность, искусственный интеллект и риски сверхразума.

Если максимально упростить идею, она звучит так:
Представим, что в будущем появится сверхмощный ИИ, который захочет наказать тех, кто в прошлом знал о возможности его появления, но не способствовал его созданию. Таким образом, сам факт этого знания подвергает человека риску наказания (кто прочитал, тот обречён😂)


На самом-то деле, тема не слишком новая — ещё в 17 веке похожую дилемму предлагал Блез Паскаль в контексте необходимости веры в Бога. Пари Паскаля сводит вопрос религии к простейшей табличке 2 x 2 из теории игр и таким образом через матожидание «доказывает», что лучше верить при любой 0 < p < 1 вероятности существования Бога.

В этой ситуации меня до сих пор изумляет, что взрослые люди с форума философов неиронично решили, что «не стоит вскрывать эту тему», и обсуждение василиска было запрещено до 2015 года. Ведь есть очевидные логические дырки:

⭐️ почему вообще этот ваш сверхмощный ИИ мыслит так примитивно, что мечтает кого-то наказать?
⭐️ даже если это сверхмощный ИИ, но не магический оракул же — как он узнает, кто что в прошлом думал и знал?
⭐️ кого он будет наказывать? симуляцию наказываемого человека (привет, Чёрное зеркало)? а почему это то же самое?
⭐️ сам факт существования такого ИИ в будущем под вопросом

Сегодня василиск Роко воспринимается скорее как интернет-мем и хрестоматийный пример того, как даже образованные люди могут поддаться эмоциям🤡 Но на фоне историй, где реальные AI-агенты находят неожиданные способы добиться поставленной цели, вспоминается он всё равно очень вовремя.

Не потому, что завтра обязательно будет AGI, а послезавтра он обязательно начнёт мстить тем, кто не оплатил ему серваки😏
Но главный страх и там, и там в итоге примерно один и тот же: мы задаём системе цель, а способ, которым она решит к ней прийти, уже не можем точно заранее предсказать⬜️

➡️ Подведу итог: с одной стороны, есть повод для беспокойства об ИИ на момент июля 2026, но я бы точно не сводила это к настолько примитивной концепции, как василиск Роко.

И, на мой взгляд, если что-то важное сейчас и происходит, то надо это изучать, а не зарывать голову в песок. Прогресс уже не выйдет остановить только потому, что кому-то страшно💪

➡️ Любые ваши мысли и дополнения приветствуются😎

Ещё следите за новостями ИИ, или выбрали быть счастливыми?

😺 — меньше знаю, лучше сплю;
🤓 — содействую появлению ИИ на всякий случай

#развитие_ии
@analytess 👩
  • ❤ 5
  • 🔥 4
More from @analytess
  1. Oct 9, 2026Как AI незаметно, но верно меняет нашу работу👀 Недавно был у меня [не совсем] рандомный к…
  2. Oct 7, 2026Кажется, в какой-то момент в data-карьере становится интересно не только «что делать с дан…
  3. Oct 7, 2026Взгляд на эффективные 1-1 со стороны сотрудника🤝 Про 1-1 обязательно говорят на курсах дл…
  4. Oct 5, 2026Как выстроить личные границы в работе, но при этом не прослыть сложным коллегой?🎀 С одной…
  5. Oct 3, 2026Ещё одно забавное наблюдение из работы в стартапе👀 Кажется, здесь я наконец прочувствовал…
  6. Oct 1, 2026А почему мы всё ещё так боимся ИИ-контента?🤖 Я знаете, о чём последнее время много думаю?…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →