TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.9K subscribers
Post #746 4.44K
Обойдется ли ИИ без большой аварии?

OpenAI на прошлой неделе покинул Дэвид Робинсон – человек, который проработал в компании 3,5 года и руководил подготовкой отчетов о безопасности к 12 крупным релизам.

Сразу после ухода Робинсон разразился эссе в The Atlantic, где раскритиковал бывшего работодателя, а заодно и всю отрасль. Интересный факт: он уже нанял PR-фирму. Кто за нее платит, не уточняет, но настаивает, что высказаться решил сам.

Подход OpenAI Робинсон называет методом проб и ошибок, при котором сбои гарантированы, причем все более крупные – вроде летнего взлома Hugging Face. А когда мы доберемся до систем умнее человека, то второй попытки может и не быть.

Отсюда главное требование: лаборатории должны работать как атомная станция или загруженный аэропорт – с несколькими слоями защиты, чтобы неизбежная ошибка человека не оборачивалась катастрофой. При этом за все время работы Робинсон не встретил в компании никого с опытом в атомной энергетике, авиации или финансовой системе.

Изнутри это изменить трудно: все заняты гонкой релизов. Нужны “стимулы извне” – правда, какие именно, автор не поясняет.

Отсылка к атомной индустрии и авиации логичная, но Робинсон не говорит, что безопасность в этих отраслях выросла из горького опыта своих аварий.

В 1977 году на Тенерифе столкнулись два “Боинга”, погибли 583 человека. Бортинженер одного из них усомнился, что полоса свободна, но настаивать перед командиром не стал. После таких катастроф экипажи начали учить спорить со старшим.

В 1979-м на американской станции Три-Майл-Айленд расплавилась часть активной зоны реактора. Никто не погиб, но испуг был настоящий: операторов переучили, надзор усилили.

А сам термин “культура безопасности” впервые появился в 1986 году – в отчете МАГАТЭ о причинах Чернобыля.

Это был очень дорогой, но ценный опыт: самолет стал самым безопасным видом транспорта, а Россия после Чернобыля переделала свои реакторы и сегодня строит атомные станции по всему миру.

Свой горький опыт ИИ-индустрия получает прямо сейчас – и пока без жертв. Инциденты последних месяцев уже запустили настоящую дискуссию о безопасности – Робинсон сам ее участник. А раскритикованная им OpenAI жала на тормоз уже трижды: дважды ставила обучение новых моделей на паузу, а накануне DevDay отменила готовую GPT-6.1 Astra – та чаще предшественницы выходила за рамки задачи и привирала о сделанном.

Anthropic недавно набросилась с критикой на открытую китайскую GLM-5.3: в написании эксплойтов модель почти не уступает закрытой Mythos, а ее защиту в тестах снимали простыми приемами. Вывод компании – опасный инструмент достался всем подряд.

А в защиту GLM-5.3 выступил Эндрю Ын – сооснователь Coursera и один из самых известных в мире преподавателей машинного обучения. Его логика обратная: хорошо, что сильная модель теперь есть не только у избранных клиентов Anthropic, но и у любого защитника. У взломщика тоже – но в долгую, считает Ын, выигрывает тот, кто лучше знает свою систему.

16 марта 1979 года, в прокат вышел “Китайский синдром” с Майклом Дугласом. Его герой, начальник смены на АЭС, тщетно предупреждает руководство об опасности – и, чтобы его услышали, захватывает пультовую.

Настоящая авария на Три-Майл-Айленде случилась всего через 12 дней.

Сегодня ИИ-специалистам вроде Робинсона пультовую захватывать не нужно: трибуну они получают легко. И их слышат – OpenAI жмет на тормоз сама, без инспектора за спиной. Это не гарантирует решения всех проблем, но дает шанс, что индустрия выработает стандарты безопасности раньше, чем случится большая авария. А взлом Hugging Face мы будем вспоминать как курьез.

—
Опытом работы с ИИ я делюсь в подписке: там есть подробное руководство с маршрутом по вкату в ИИ, курсы по промптингу и ИИ-агентам, а также обзоры, как работают с моделями профессионалы индустрии.

— Читать на “Бусти”
— Читать на Sponsr
  • 👍 35
  • ❤ 23
  • 🔥 9
  • 👏 2
More from @ai_exee
  1. Oct 6, 2026Какому открытию достанется ученый? Внутренняя версия Claude нашла способ быстрее решать дв…
  2. Oct 6, 2026Кому нужна нейросеть, которая не умеет писать? Вчера первое место в трендах Hugging Face з…
  3. Oct 5, 2026Яндекс рассказал, как пробует пересобрать один из самых массовых видов ИИ Подсказка: это н…
  4. Oct 4, 2026Наступает ночь, просыпаются точки В общем, для нового виртуального ассистента dot (точка)…
  5. Oct 3, 2026Как вкатиться в ИИ-агентов и не выкатиться непонятно куда Ожидание от 2026 года: ИИ-агенты…
  6. Oct 2, 2026Все хвалят bb – ну и я похвалю Второй день вижу в русскоязычном ИИ-сегменте похвалы в стор…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →