Обойдется ли ИИ без большой аварии?
OpenAI на прошлой неделе покинул Дэвид Робинсон – человек, который проработал в компании 3,5 года и руководил подготовкой отчетов о безопасности к 12 крупным релизам.
Сразу после ухода Робинсон разразился эссе в The Atlantic, где раскритиковал бывшего работодателя, а заодно и всю отрасль. Интересный факт: он уже нанял PR-фирму. Кто за нее платит, не уточняет, но настаивает, что высказаться решил сам.
Подход OpenAI Робинсон называет методом проб и ошибок, при котором сбои гарантированы, причем все более крупные – вроде летнего взлома Hugging Face. А когда мы доберемся до систем умнее человека, то второй попытки может и не быть.
Отсюда главное требование: лаборатории должны работать как атомная станция или загруженный аэропорт – с несколькими слоями защиты, чтобы неизбежная ошибка человека не оборачивалась катастрофой. При этом за все время работы Робинсон не встретил в компании никого с опытом в атомной энергетике, авиации или финансовой системе.
Изнутри это изменить трудно: все заняты гонкой релизов. Нужны “стимулы извне” – правда, какие именно, автор не поясняет.
Отсылка к атомной индустрии и авиации логичная, но Робинсон не говорит, что безопасность в этих отраслях выросла из горького опыта своих аварий.
В 1977 году на Тенерифе столкнулись два “Боинга”, погибли 583 человека. Бортинженер одного из них усомнился, что полоса свободна, но настаивать перед командиром не стал. После таких катастроф экипажи начали учить спорить со старшим.
В 1979-м на американской станции Три-Майл-Айленд расплавилась часть активной зоны реактора. Никто не погиб, но испуг был настоящий: операторов переучили, надзор усилили.
А сам термин “культура безопасности” впервые появился в 1986 году – в отчете МАГАТЭ о причинах Чернобыля.
Это был очень дорогой, но ценный опыт: самолет стал самым безопасным видом транспорта, а Россия после Чернобыля переделала свои реакторы и сегодня строит атомные станции по всему миру.
Свой горький опыт ИИ-индустрия получает прямо сейчас – и пока без жертв. Инциденты последних месяцев уже запустили настоящую дискуссию о безопасности – Робинсон сам ее участник. А раскритикованная им OpenAI жала на тормоз уже трижды: дважды ставила обучение новых моделей на паузу, а накануне DevDay отменила готовую GPT-6.1 Astra – та чаще предшественницы выходила за рамки задачи и привирала о сделанном.
Anthropic недавно набросилась с критикой на открытую китайскую GLM-5.3: в написании эксплойтов модель почти не уступает закрытой Mythos, а ее защиту в тестах снимали простыми приемами. Вывод компании – опасный инструмент достался всем подряд.
А в защиту GLM-5.3 выступил Эндрю Ын – сооснователь Coursera и один из самых известных в мире преподавателей машинного обучения. Его логика обратная: хорошо, что сильная модель теперь есть не только у избранных клиентов Anthropic, но и у любого защитника. У взломщика тоже – но в долгую, считает Ын, выигрывает тот, кто лучше знает свою систему.
16 марта 1979 года, в прокат вышел “Китайский синдром” с Майклом Дугласом. Его герой, начальник смены на АЭС, тщетно предупреждает руководство об опасности – и, чтобы его услышали, захватывает пультовую.
Настоящая авария на Три-Майл-Айленде случилась всего через 12 дней.
Сегодня ИИ-специалистам вроде Робинсона пультовую захватывать не нужно: трибуну они получают легко. И их слышат – OpenAI жмет на тормоз сама, без инспектора за спиной. Это не гарантирует решения всех проблем, но дает шанс, что индустрия выработает стандарты безопасности раньше, чем случится большая авария. А взлом Hugging Face мы будем вспоминать как курьез.
—
Опытом работы с ИИ я делюсь в подписке: там есть подробное руководство с маршрутом по вкату в ИИ, курсы по промптингу и ИИ-агентам, а также обзоры, как работают с моделями профессионалы индустрии.
— Читать на “Бусти”
— Читать на Sponsr
Post #746
4.44K

- 👍 35
- ❤ 23
- 🔥 9
- 👏 2