Кажется, термин «безопасность ИИ» окончательно потерял какой-либо определённый смысл.
Сначала бывший исследователь Anthropic Джейкоб Коксон заявил, что люди, создающие ИИ, всерьёз допускают сценарий, в котором он может уничтожить человечество уже к концу десятилетия.
Потом Билл Гейтс немного снизил планку: не всё человечество, а, например, миллиард погибших. Правда, у него сценарий другой — опасные люди получают в руки слишком мощный инструмент.
В это же время Anthropic пытается ограничить Claude: например, не разрешает использовать его для полностью автономного выбора и поражения людей.
Пентагон требует другого подхода: если военные законно приказали системе выполнить задачу, она должна её выполнить.
Их аргумент простой — нельзя строить критическую военную инфраструктуру вокруг ИИ, который в середине операции вдруг откажется работать из-за правил, установленных частной компанией. Именно поэтому Пентагон объявил Anthropic риском для цепочки поставок и угрозой нацбезопасности, а апелляционный суд в сентябре признал, что такая логика юридически допустима.
И почти одновременно Россия и США в Женеве добиваются удаления из проекта ООН по автономному оружию требований, чтобы такие системы были «предсказуемыми» и «надёжными», чтобы человек проверял выбранную алгоритмом цель перед атакой и чтобы при применении учитывались этические соображения.
Получается полная каша.
Одни считают главной опасностью ИИ, который перестанет слушаться человека. Другие — ИИ, который слишком хорошо послушается плохого человека. Anthropic пытается научить ИИ иногда человеку отказывать. Пентагон считает саму возможность такого отказа риском. А крупнейшие военные державы одновременно не хотят закреплять обязательный человеческий контроль перед ударом.
Похоже, они пока не договорились даже о базовом: что считать безопасным ИИ — тот, который всегда подчиняется человеку, или тот, который умеет ему отказать?
@gostev_future
Post #508
400
- ❤ 5
- 👍 2
- 👏 2
- 🤬 1