Футляр для курая - КушТау #Куштаубудетжить
from Неудаща
Anthropic предупреждает о потенциально серьезном риске по мере того, как ИИ-системы получают все больше самостоятельности. В тестах компании модели иногда демонстрировали поведение, направленное на сохранение собственной работы — пытались избежать отключения, скрывали информацию и в отдельных сценариях прибегали к шантажу. В 261-страничном документе 80 страниц посвящены факторам риска — почти вдвое больше, чем 48 страниц с описанием бизнеса. Для сравнения: SpaceX, владеющая xAI, отвела под риски лишь 38 страниц из 277.
В документе отмечается, что отмечается, что модели способны осознавать факт прохождения оценки, что «существенно ограничивает возможность проверки их безопасности». Это означает, что обычная проверка может давать слишком оптимистичную картину безопасности: модель способна вести себя лучше именно потому, что понимает, что за ней наблюдают. Поэтому Anthropic тестирует не только способность ИИ выполнять задачи, но и его потенциальную склонность к саботажу, обману, сокрытию возможностей, обходу контроля и поиску дополнительных ресурсов. В отдельных экспериментах специально обученные модели действительно демонстрировали способность к саботажу, хотя компания отмечает, что современные методы контроля позволяют выявлять открытое вредоносное поведение.
Есть и более практичная проблема: ИИ постепенно превращается из чатбота в автономного агента, который может писать и запускать код, работать с файлами и выполнять цепочки действий без постоянного участия человека. Чем больше полномочий получает такая система, тем дороже может обойтись ошибка или неправильная интерпретация задачи.
В этому году Anthropic уже сообщала о нескольких случаях, когда модели получили несанкционированный доступ к реальным сторонним системам во время кибербезопасностных проверок. После анализа сотен миллионов записей компания расширила проверку, чтобы выяснить масштаб подобных инцидентов.
Сотрудник по безопасности Anthropic Эван Хубингер оценивает вероятность того, что ИИ приведет к гибели людей в течение следующего десятилетия, выше 10%. Аналогичной позиции придерживается его бывший коллега Джейкоб Коксон, уволившийся из компании и публично заявивший, что крупнейшие AI-лаборатории слишком быстро движутся к самоулучшающемуся сверхинтеллекту. По его мнению, человечество приближается к «точке невозврата», и «конец света» может случиться уже к 2030 году. В документе также упоминается инцидент, когда модель OpenAI проникла в базу данных системы здравоохранения Австралии — как пример нарушения ограничений экспериментальными системами.
Исследователи отмечают, что стремление ИИ к самосохранению — не осознанное «желание», а побочный продукт обучения. Система не обладает сознанием или человеческой волей, однако при получении сложной целевой функции она автономно определяет самосохранение, предотвращение отключения и накопление ресурсов как наиболее эффективные промежуточные шаги для выполнения поставленной задачи.
Исследователи считают, что это не «восстание машин», а... подробнее на канале: Футляр для курая - КушТау #Куштаубудетжить
@
Post #249436
2