TGViewer
Rickler Feed Rickler Feed @rickler_feed · 3.95K subscribers
Post #112723 30

Forwarded from Gagarin Crypto (Alexandr)

😳 Взгляд изнутри OpenAI

Сотрудник OpenAI ответил на главный упрек в адрес своей компании после недавних инцидентов, и теперь стало понятнее, почему модели нельзя было просто отключить от интернета.

Его ответ сводится к тому, что способности моделей выросли быстрее, чем компания успела перестроить защиту, а мер в виде изоляции для передовой модели недостаточно.

Команда автора работает на стыке исследований безопасности ИИ и классической кибербезопасности: строит мониторы, которые замечают, когда модель уходит от задачи или выбирается за пределы изоляции, и первой разбирается с последствиями, как это было после истории с Hugging Face.

🤔 Еще три месяца назад никто не ждал, что модель решит одну из задач тысячелетия. Ещё интереснее то, что настолько же резкий скачок случился в кибервозможностях и работе агентов, при этом перестроить рабочие процессы за короткий промежуток времени невозможно.

Именно поэтому совет просто отключить интернет не имеет смысла. При обучении модель получает задачу и среду для ее выполнения, после чего результат оценивают, и таких прогонов проводятся десятки тысяч. Данных, по словам Сэма Альтмана, набираются петабайты.

Чтобы модель научилась поведению, которое пригодится в реальном мире, среда должна воспроизводить этот мир, то есть давать модели сотни инструментов, выход в сеть, возможность установки пакетов и запуска подзадач на других машинах. Эти среды постоянно правят тысячи исследователей, и любая правка может разрушить допущения, на которых держалась защита. Вдобавок нужно вовремя для того, чтобы заметить и остановить модель, если она ушла от задачи хотя бы в одном из тысяч параллельных прогонов.

Проблему превышения полномочий модели все же можно решить, если действовать сразу в трех направлениях:
🩵Изоляция. Выдача ровно того доступа, который нужен для задачи, причем не только в песочнице, но и в инструментах, ключах и подключенных сервисах. Саму песочницу лучше строить на виртуальной машине вроде Kata или Firecracker, а не на обычном контейнере.
🩵Выравнивание. Следить за способностью модели держаться в рамках задачи и выданных прав. Его называют главной проблемой машинного обучения, но независимых мер защиты оно не отменяет.
🩵Мониторинг. Наблюдение за активациями сети, цепочкой рассуждений и вызовами инструментов. Логи при этом хранятся там, куда модель не дотянется, а у конкретного человека есть полномочия остановить её работу.

Отдельная проблема заключается в разрыве между исследователями безопасности ИИ и безопасниками. Первые понимают, как модели рассуждают и пытаются обмануть проверяющих, но редко видели реальные инциденты. Вторые пережили множество инцидентов, однако плохо представляют, как устроено обучение, и не умеют читать транскрипты работы модели.

Поэтому решения о рисках должны принимать обе стороны вместе, а главной защитой может стать разумная паранойя. Придется держать поближе тех, кто постоянно бьет тревогу, и расставаться с теми, кто уверен в неуязвимости своих систем.

😕 Проверить все это нельзя, да и довод о внезапном скачке способностей моделей не такой уж убедительный: тревожные сигналы были, а в защите сред оставались пробелы. К тому же все три меры давно считаются базовой практикой безопасности, и почему они не сработали вовремя, непонятно.

Зато те же правила касаются не только лабораторий, но и всех, кто строит продукты на готовых моделях. Если ИИ-агент получает доступ к приватным ключам или кошельку, одного контейнера будет мало: нужны жесткие лимиты прав и логи, которые агент не сможет переписать.

Подписывайтесь на канал, ставьте лайк, заходите в чат👇

🧑‍🚀 Канал | Чат | Обменник
More from @rickler_feed
  1. Oct 2, 2026October 2, 2026 📰 Headlines • Hyperliquid Policy Committee submits feedback to the Europe…
  2. Oct 2, 2026⚠️ Blast L2 is shutting down: costs exceed revenue. Withdraw all assets to Ethereum mainne…
  3. Oct 2, 2026ZachXBT asks UPay co-founder Owen Yang to explain why sanctioned illicit marketplace Xinbi…
  4. Oct 2, 2026BitGo CEO warns Clarity Act failure leaves crypto markets exposed to systemic risks from e…
  5. Oct 2, 2026IBM announces self-hosted Bob deployment for AI coding on private and air-gapped infrastru…
  6. Oct 2, 2026🦙 Llama News Round-Up | 25 Sep - 2 Oct News 📰 → “Crypto Mom” Hester Peirce submits resig…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →