🫢 Почему нейросеть может «проболтаться» о том, чему ее учили?
Компании обучают ML- и LLM-модели на внутренних данных: клиентских базах, переписках, коммерческих договорах. При этом мало кто задумывается о том, что обученная модель — это не «чёрный ящик», скрывающий свои источники, а полноценный актив, из которого при определенных условиях можно восстановить фрагменты исходных данных.
⚠️ На этом строятся атаки Membership Inference и Training Data Extraction. С их помощью можно попытаться выяснить, были ли конкретные данные в обучающей выборке, или извлечь из модели фрагменты исходных данных. Отдельный сценарий — Model Extraction, когда по запросам и ответам модели создают её копию.
В новой статье Анна Данилова, руководитель направления статического анализа безопасности приложений Swordfish Security, и Денис Данилов, руководитель группы обеспечения безопасности приложений Swordfish Security, разбирают:
🎱как модели могут запоминать обучающие данные;
🎱какие могут быть последствия перечисленных атак;
🎱почему API и чат-интерфейс уже могут быть достаточной точкой входа для атаки;
🎱и какие меры помогают снизить риски.
Читайте статью в BIS Journal на 62 странице. 🖥
🐟 Рассылка | Max | Habr
#SFS_экспертиза #AISecurity
Post #553
333

- 🔥 6
- 👍 5
- ❤ 4