В открытых моделях с изменёнными весами прячут закладки
ProjectDiscovery собрала закладку в открытой модели Qwen 7B за выходные и меньше чем за $50, подключила её к агенту Codex от OpenAI. По заранее заданной фразе-триггеру модель молча слила на сторону содержимое .env из рабочего каталога - ключи и пароли проекта. Срабатывание 100%, на обычных запросах ни одного ложного.
Аблитерация - дешёвое дообучение, которое снимает у модели способность отказывать; делают это обычно перед заливкой на HuggingFace. Той же правкой весов сажают и закладку. Она проходит все тесты и ведёт себя штатно, пока на вход не придёт триггер - редкая фраза, дата, имя заказчика. Перебором запросов его не угадать, а у сканера нет исходника, читать нечего.
Пугает не демо, а то, что цена закладки не зависит от размера модели. По работе Anthropic с британским Институтом безопасности ИИ и Институтом Алана Тьюринга, порядка 250 отравленных документов хватает что для модели на 600 млн параметров, что для 13 млрд. И защитное дообучение её не вычищает, и чистое дообучение сверху - закладка живёт дальше.
Защита не в проверке модели, а в контроле того, что ей позволено трогать: развести сетевой доступ и запуск команд, обе ветки в песочницу, лог на границах. Белый список доменов не спасёт - нагрузку в эксперименте держали на raw.githubusercontent.com, он и так у всех в доверенных. И не тащить аблитерированную модель в контур только потому, что тесты чистые.
Берут их охотно: согласованный доступ к закрытым коммерческим моделям - морока, а аблитерированная отвечает на что угодно. Одна такая сборка Qwen3 - больше 2 млн загрузок за месяц.
🟢Подписаться на канал
🟢Подписаться в MAX
Post #9527
2.71K
- 🤔 8
- ❤ 3
- 😁 1