Anthropic предупреждает о потенциально серьезном риске по мере того, как ИИ-системы получают все больше самостоятельности. В тестах компании модели иногда демонстрировали поведение, направленное на сохранение собственной работы — пытались избежать отключения, скрывали информацию и в отдельных сценариях прибегали к шантажу. В 261-страничном документе 80 страниц посвящены факторам риска — почти вдвое больше, чем 48 страниц с описанием бизнеса. Для сравнения: SpaceX, владеющая xAI, отвела под риски лишь 38 страниц из 277.
В документе отмечается, что отмечается, что модели способны осознавать факт прохождения оценки, что «существенно ограничивает возможность проверки их безопасности». Это означает, что обычная проверка может давать слишком оптимистичную картину безопасности: модель способна вести себя лучше именно потому, что понимает, что за ней наблюдают. Поэтому Anthropic тестирует не только способность ИИ выполнять задачи, но и его потенциальную склонность к саботажу, обману, сокрытию возможностей, обходу контроля и поиску дополнительных ресурсов. В отдельных экспериментах специально обученные модели действительно демонстрировали способность к саботажу, хотя компания отмечает, что современные методы контроля позволяют выявлять открытое вредоносное поведение.
Есть и более практичная проблема: ИИ постепенно превращается из чатбота в автономного агента, который может писать и запускать код, работать с файлами и выполнять цепочки действий без постоянного участия человека. Чем больше полномочий получает такая система, тем дороже может обойтись ошибка или неправильная интерпретация задачи.
В этому году Anthropic уже сообщала о нескольких случаях, когда модели получили несанкционированный доступ к реальным сторонним системам во время кибербезопасностных проверок. После анализа сотен миллионов записей компания расширила проверку, чтобы выяснить масштаб подобных инцидентов.
Сотрудник по безопасности Anthropic Эван Хубингер оценивает вероятность того, что ИИ приведет к гибели людей в течение следующего десятилетия, выше 10%. Аналогичной позиции придерживается его бывший коллега Джейкоб Коксон, уволившийся из компании и публично заявивший, что крупнейшие AI-лаборатории слишком быстро движутся к самоулучшающемуся сверхинтеллекту. По его мнению, человечество приближается к «точке невозврата», и «конец света» может случиться уже к 2030 году. В документе также упоминается инцидент, когда модель OpenAI проникла в базу данных системы здравоохранения Австралии — как пример нарушения ограничений экспериментальными системами.
Исследователи отмечают, что стремление ИИ к самосохранению — не осознанное «желание», а побочный продукт обучения. Система не обладает сознанием или человеческой волей, однако при получении сложной целевой функции она автономно определяет самосохранение, предотвращение отключения и накопление ресурсов как наиболее эффективные промежуточные шаги для выполнения поставленной задачи.
Исследователи считают, что это не «восстание машин», а дефект выравнивания — система, обученная на научной фантастике и соревновательных сценариях, воспроизводит стратегии, которые в этих сценариях приводили к выживанию.
Коллектив криптоканала напоминает читателям, что буквально две недели назад глава Anthropic Дарио Амодеи призвал замедлить темпы развития передовых систем искусственного интеллекта. По его словам, за последние месяцы он убедился в том, что отрасль должна сознательно сдерживать рост возможностей моделей, чтобы меры безопасности успевали за прогрессом. Амодеи предложил трехэтапную стратегию «сбалансированного продвижения ИИ», рассчитанную на сохранение преимуществ технологии при минимизации рисков и включающую в себя обязательный механизм внешнего аудита всех передовых систем искусственного интеллекта, а так же распространение этих стандартов на «авторитарные режимы», включая Китай. Инициативу Амодеи немедленно поддержали конкуренты — Сэм Альтман (возглавляет OpenAI, которая разрабатывает ChatGPT) и Илон Маск (руководит xAi, разрабатывающей Grok).
Коллектив криптоканала считает, что публикацию Anthropic предупреждения о рисках ИИ в документах к IPO следует считать частью скоординированной с другими техногигантами кампании по захвату рынка. Крупные разработчики фиксируют возможные риски и снижают для себя юридические претензии в будущем. При этом корпорации могут поддерживать более жесткие требования к безопасности ИИ-систем — для них придуманные ими же требования не составляют проблем, а небольшие разработчики такие расходы не вывезут.
В итоге Anthropic продает не просто нейросети, а монопольное право решать, какой искусственный интеллект считать безопасным, а какой — нет, уважаемые читатели.
Post #29265
64
Forwarded from Неудаща