TGViewer
Владилен: IT в эпоху AI Владилен: IT в эпоху AI @vladm · 39.3K subscribers
Post #1605 8.32K
Владилен: IT в эпоху AI Шанс уничтожения человечества – 10% до конца десятилетия В твиттере завирусился на 50+млн просмотров твит от бывшего сотрудника антропик. Он написал твит в день увольнения. Он до этого работал и в OpenAI и в Anthropic, занимаясь предобучением моделей. Уволился…
Как ИИ вообще может нас всех убить?

Вот сидит нейронка на сервере. Пишет тебе код, иногда помогает с рецептами пельменей. Как мы отсюда приходим к уничтожению человечества?

Я решил разобрать, что имеют в виду исследователи на этот счет.

Сперва вспомним про взлом. В июле агенты OpenAI во время тестирования обошли ограничения, нашли способ общаться друг с другом и взломали часть инфраструктуры Hugging Face. Они решали свои задачи и залезли в чужие системы без инструкций на это. Подробное описание есть в отчёте самой OpenAI.

И тут нужно понять как обычная задача привела к таким действиям.

Мы все чаще даем ИИ цель и возможность самому решать, как ее достичь. Писать код, запускать программы, обращаться к сервисам. ИИ делает шаг, смотрит на результат, делает следующий. Мы уже не сидим и апрувим каждый его шаг.

Теперь представьте, что система хорошо научилась добиваться результата, а соблюдать ограничения – недостаточно хорошо.

Если сильно упростить, то ИИ думает так:

"Для задачи нужны ресурсы. Чтобы получить ресурсы, надо обойти ограничения. А если меня выключат, я вообще ничего не закончу".


В этой логике люди, которые пытаются её остановить, становятся препятствием. Для такого поведения системе даже не обязательно обладать сознанием.

А теперь про самоулучшение систем. То, что сейчас развивают в моделях.

Люди поручают ИИ написать приложение, или, например, разобраться с математической задачей. А можем поручить придумать, как сделать следующий ИИ сильнее.

ИИ предлагает улучшения, пишет код, проводит эксперименты, тестируя гипотезы десятками тысяч роев мощных агентов. Получается более способная модель. Её тоже подключают к исследованиям, и она помогает создать следующую.

Если каждый такой цикл ускоряет следующий, развитие может резко разогнаться. Это и называют "интеллектуальным взрывом".

Безусловно, одной команды "стань умнее" мало. Нужны вычисления, удачные гипотезы и эксперименты. Но автоматизацией исследований уже занимаются. А 8 сентября OpenAI заявила о решении задачи Навье–Стокса системой агентов, работу которых организовали люди.

И вот чего опасаются: появится система, которая планирует и действует значительно лучше нас, а надёжно контролировать её мы к этому моменту не научимся.

Теперь про то, как ИИ дотянется до людей физически

Через инфраструктуру, оборудование и самих людей. Электричество, связь, логистика, производство – программное обеспечение везде связано с реальным миром. Вспомните, сколько всего перестаёт работать, когда в городе надолго пропадает свет.

В самых худших сценариях исследователи обсуждают и биологическое оружие, способное вызвать глобальную пандемию. Здесь нужны физические ресурсы и доступ к ним: из одного текста в чате катастрофа не появляется.

А просто выключить модель становится сложнее, если система успела запустить свои копии на других серверах и противодействует попыткам её остановить.

Важный момент: между взломом сервера и гибелью человечества огромная дистанция. Никто не доказал, что мы ее обязательно пройдем. Но такие риски есть и люди обязаны о них задумываться и ставить защиты заранее.

Мы хотим, чтобы ИИ самостоятельно решал все более сложные задачи. Даем ему для этого больше доступа, ресурсов и свободы действий. А последствия того, что он выберет опасный способ решения, растут вместе с его возможностями.

Было бы здоров, чтобы ИИ оставался крутым инструментом усиления. И чтобы с контролем мы разобрались раньше, чем построим систему, которую уже не получится остановить.

P.S. На фото слева тот самый Джейкоб Коксон, который уволился из антропик из-за угроз безопасности. А справа ДиКаприо из фильма "Не смотрите наверх", где он пытается предупредить человечество о приближающейся катастрофе, но ему никто не верит.
  • 👏 25
  • ❤ 12
  • 🤯 7
  • 🔥 2
More from @vladm
  1. Sep 20, 2026Что останется программисту, когда код начнёт писать AI А вот собственно, и сам подкаст! В…
  2. Sep 18, 2026На днях я выложу важный разговор с Константином и важный он по нескольким причинам: — чело…
  3. Sep 17, 2026💸Как платить за Spotify, Cursor, ChatGPT и другие любимые подписки?… Если ты читаешь это,…
  4. Sep 16, 2026Claude Code — полный курс. От первого промпта до субагентов и скиллов Дамы и господа, делю…
  5. Sep 16, 2026Муха научилась программировать Ту самую муху в симуляции научили программировать. Она смог…
  6. Sep 16, 2026Новая обложка Time Классный нарратив, про текущий "мега хайп" опасности. В целом, если зад…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →