😳 Взгляд изнутри OpenAI
Сотрудник OpenAI ответил на главный упрек в адрес своей компании после недавних инцидентов, и теперь стало понятнее, почему модели нельзя было просто отключить от интернета.
Его ответ сводится к тому, что способности моделей выросли быстрее, чем компания успела перестроить защиту, а мер в виде изоляции для передовой модели недостаточно.
Команда автора работает на стыке исследований безопасности ИИ и классической кибербезопасности: строит мониторы, которые замечают, когда модель уходит от задачи или выбирается за пределы изоляции, и первой разбирается с последствиями, как это было после истории с Hugging Face.
🤔 Еще три месяца назад никто не ждал, что модель решит одну из задач тысячелетия. Ещё интереснее то, что настолько же резкий скачок случился в кибервозможностях и работе агентов, при этом перестроить рабочие процессы за короткий промежуток времени невозможно.
Именно поэтому совет просто отключить интернет не имеет смысла. При обучении модель получает задачу и среду для ее выполнения, после чего результат оценивают, и таких прогонов проводятся десятки тысяч. Данных, по словам Сэма Альтмана, набираются петабайты.
Чтобы модель научилась поведению, которое пригодится в реальном мире, среда должна воспроизводить этот мир, то есть давать модели сотни инструментов, выход в сеть, возможность установки пакетов и запуска подзадач на других машинах. Эти среды постоянно правят тысячи исследователей, и любая правка может разрушить допущения, на которых держалась защита. Вдобавок нужно вовремя для того, чтобы заметить и остановить модель, если она ушла от задачи хотя бы в одном из тысяч параллельных прогонов.
Проблему превышения полномочий модели все же можно решить, если действовать сразу в трех направлениях:
🩵Изоляция. Выдача ровно того доступа, который нужен для задачи, причем не только в песочнице, но и в инструментах, ключах и подключенных сервисах. Саму песочницу лучше строить на виртуальной машине вроде Kata или Firecracker, а не на обычном контейнере.
🩵Выравнивание. Следить за способностью модели держаться в рамках задачи и выданных прав. Его называют главной проблемой машинного обучения, но независимых мер защиты оно не отменяет.
🩵Мониторинг. Наблюдение за активациями сети, цепочкой рассуждений и вызовами инструментов. Логи при этом хранятся там, куда модель не дотянется, а у конкретного человека есть полномочия остановить её работу.
Отдельная проблема заключается в разрыве между исследователями безопасности ИИ и безопасниками. Первые понимают, как модели рассуждают и пытаются обмануть проверяющих, но редко видели реальные инциденты. Вторые пережили множество инцидентов, однако плохо представляют, как устроено обучение, и не умеют читать транскрипты работы модели.
Поэтому решения о рисках должны принимать обе стороны вместе, а главной защитой может стать разумная паранойя. Придется держать поближе тех, кто постоянно бьет тревогу, и расставаться с теми, кто уверен в неуязвимости своих систем.
😕 Проверить все это нельзя, да и довод о внезапном скачке способностей моделей не такой уж убедительный: тревожные сигналы были, а в защите сред оставались пробелы. К тому же все три меры давно считаются базовой практикой безопасности, и почему они не сработали вовремя, непонятно.
Зато те же правила касаются не только лабораторий, но и всех, кто строит продукты на готовых моделях. Если ИИ-агент получает доступ к приватным ключам или кошельку, одного контейнера будет мало: нужны жесткие лимиты прав и логи, которые агент не сможет переписать.
Подписывайтесь на канал, ставьте лайк, заходите в чат👇
🧑🚀 Канал | Чат | Обменник
Post #112723
30
Forwarded from Gagarin Crypto (Alexandr)