Ни одна библиотека не застрахована от уязвимостей, особенно в сложных экосистемах с десятками транзитивных зависимостей и частыми обновлениями.
Анализ и рекомендации ниже основаны на разделе 6.4 обучающего курса “Fundamentals of Secure AI Systems with Personal Data” из программы Support Pool of Experts, подготовленного по заказу (EDPB).
1. Используйте надежные источники:
Всегда устанавливайте библиотеки из официальных репозиториев (PyPI, Conda, GitHub orgs).
Проверяйте целостность с помощью контрольных сумм или цифровых подписей, если они доступны.
2. Отслеживайте CVE (распространенные уязвимости и риски) через:
Snyk, OSV.dev, pip-audit
3. Проводите анализ зависимостей:
Конвейеры машинного обучения часто включают десятки косвенных зависимостей.
Используйте такие инструменты, как pipdeptree (для сопоставления и анализа деревьев пакетов)
pip-audit (для проверки на известные уязвимости), Dependency-Check
5. Мониторинг сетевого трафика:
Некоторые библиотеки машинного обучения могут автоматически загружать наборы данных или данные телеметрии.
Используйте
netstat, tcpdump или брандмауэры для мониторинга исходящего трафика во время:6. Обучение модели:
- Предварительная обработка данных вывода
- Изолируйте среду машинного обучения
- Используйте контейнеризацию или виртуальные среды Docker, Singularity или через настройку виртуальных окружений с
venvПреимущества: ограничение ущерба в случае компрометации, лучшая зависимость и контроль версий, более простой аудит и воспроизводимость.
Помним, что ни одна модель не безопасна по умолчанию. Из распространенных угроз:
▪️Бэкдоры - в модель встроена вредоносная логика. Активируется только при определенных входных данных (например, определенных шаблонах изображений).
▪️Отравление чистой меткой. Данные кажутся правильно помеченными, но вызывают вредоносное поведение после обучения.
▪️ Эксплойты переноса обучения. Отравленные шаблоны выдерживают тонкую настройку и распространяются на последующие задачи.
▪️ Неизвестное происхождение. Если данные или процесс обучения непрозрачны, они могут вносить предвзятости, уязвимости, необнаруживаемые манипуляции, поддельные файлы
Загруженные модели могут быть напрямую изменены вредоносными полезными нагрузками.
#BehindTheMachine
@pattern_ai