TGViewer
Сибиряк Сибиряк @sidpolit · 8.15K subscribers
Post #29265 64

Forwarded from Неудаща

Anthropic предупреждает о потенциально серьезном риске по мере того, как ИИ-системы получают все больше самостоятельности. В тестах компании модели иногда демонстрировали поведение, направленное на сохранение собственной работы — пытались избежать отключения, скрывали информацию и в отдельных сценариях прибегали к шантажу. В 261-страничном документе 80 страниц посвящены факторам риска — почти вдвое больше, чем 48 страниц с описанием бизнеса. Для сравнения: SpaceX, владеющая xAI, отвела под риски лишь 38 страниц из 277.

В документе отмечается, что отмечается, что модели способны осознавать факт прохождения оценки, что «существенно ограничивает возможность проверки их безопасности». Это означает, что обычная проверка может давать слишком оптимистичную картину безопасности: модель способна вести себя лучше именно потому, что понимает, что за ней наблюдают. Поэтому Anthropic тестирует не только способность ИИ выполнять задачи, но и его потенциальную склонность к саботажу, обману, сокрытию возможностей, обходу контроля и поиску дополнительных ресурсов. В отдельных экспериментах специально обученные модели действительно демонстрировали способность к саботажу, хотя компания отмечает, что современные методы контроля позволяют выявлять открытое вредоносное поведение.

Есть и более практичная проблема: ИИ постепенно превращается из чатбота в автономного агента, который может писать и запускать код, работать с файлами и выполнять цепочки действий без постоянного участия человека. Чем больше полномочий получает такая система, тем дороже может обойтись ошибка или неправильная интерпретация задачи.

В этому году Anthropic уже сообщала о нескольких случаях, когда модели получили несанкционированный доступ к реальным сторонним системам во время кибербезопасностных проверок. После анализа сотен миллионов записей компания расширила проверку, чтобы выяснить масштаб подобных инцидентов.

Сотрудник по безопасности Anthropic Эван Хубингер оценивает вероятность того, что ИИ приведет к гибели людей в течение следующего десятилетия, выше 10%. Аналогичной позиции придерживается его бывший коллега Джейкоб Коксон, уволившийся из компании и публично заявивший, что крупнейшие AI-лаборатории слишком быстро движутся к самоулучшающемуся сверхинтеллекту. По его мнению, человечество приближается к «точке невозврата», и «конец света» может случиться уже к 2030 году. В документе также упоминается инцидент, когда модель OpenAI проникла в базу данных системы здравоохранения Австралии — как пример нарушения ограничений экспериментальными системами.

Исследователи отмечают, что стремление ИИ к самосохранению — не осознанное «желание», а побочный продукт обучения. Система не обладает сознанием или человеческой волей, однако при получении сложной целевой функции она автономно определяет самосохранение, предотвращение отключения и накопление ресурсов как наиболее эффективные промежуточные шаги для выполнения поставленной задачи.

Исследователи считают, что это не «восстание машин», а дефект выравнивания — система, обученная на научной фантастике и соревновательных сценариях, воспроизводит стратегии, которые в этих сценариях приводили к выживанию.

Коллектив криптоканала напоминает читателям, что буквально две недели назад глава Anthropic Дарио Амодеи призвал замедлить темпы развития передовых систем искусственного интеллекта. По его словам, за последние месяцы он убедился в том, что отрасль должна сознательно сдерживать рост возможностей моделей, чтобы меры безопасности успевали за прогрессом. Амодеи предложил трехэтапную стратегию «сбалансированного продвижения ИИ», рассчитанную на сохранение преимуществ технологии при минимизации рисков и включающую в себя обязательный механизм внешнего аудита всех передовых систем искусственного интеллекта, а так же распространение этих стандартов на «авторитарные режимы», включая Китай. Инициативу Амодеи немедленно поддержали конкуренты — Сэм Альтман (возглавляет OpenAI, которая разрабатывает ChatGPT) и Илон Маск (руководит xAi, разрабатывающей Grok).

Коллектив криптоканала считает, что публикацию Anthropic предупреждения о рисках ИИ в документах к IPO следует считать частью скоординированной с другими техногигантами кампании по захвату рынка. Крупные разработчики фиксируют возможные риски и снижают для себя юридические претензии в будущем. При этом корпорации могут поддерживать более жесткие требования к безопасности ИИ-систем — для них придуманные ими же требования не составляют проблем, а небольшие разработчики такие расходы не вывезут.

В итоге Anthropic продает не просто нейросети, а монопольное право решать, какой искусственный интеллект считать безопасным, а какой — нет, уважаемые читатели.
Telegram Неудаща Илон Маск поддержал призыв главы Anthropic Дарио Амодеи замедлить темпы развития передовых систем искусственного интеллекта. «Дарио прав», — написал Маск в X, отреагировав на эссе Амодеи «Мы должны осваивать рубежи» (We Must Pace the Frontier). Глава Anthropic…
More from @sidpolit
  1. Sep 29, 2026Налоги-2026: ныть прекращаем, привыкать начинаем В экспертной среде Telegram’а – слишком м…
  2. Sep 29, 2026Геннадий Зюганов на встрече с Президентом резко сменил риторику, и уже не стал говорить пр…
  3. Sep 29, 2026Коррупционер Пономаренко рвется к сенаторской неприкосновенности, опасаясь ареста Скандаль…
  4. Sep 29, 2026Мэрия Новосибирска одобрила предложение СГК о заключении третьей концессии на теплосети. Т…
  5. Sep 29, 2026Вновь избранный глава Тувы Владислав Ховалыг наделил полномочиями представителя республики…
  6. Sep 29, 2026❗️Андрей Инюшкин, кандидат юридических наук, член Российской академии юридических наук, чл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →