#короткие_ответы_на_серьезные_вопросы
На каком этапе проще всего отравить модель и как это технически детектировать?
«Самый уязвимый этап — это сбор и предобработка данных (Data Curation), потому что атака здесь стоит копейки, а влияние колоссальное. В отличие от этапа обучения, где нужны вычислительные мощности.
-Детекция дубликатов и аномалий: Использую хеширование (SimHash) для поиска почти идентичных семплов. Если злоумышленник добавил 1000 одинаковых "отравленных" примеров в датасет из 1 млн, это всплывет как аномальный кластер в эмбеддинг-пространстве.
-Статистический анализ лейблов: Смотрю на распределение целевых переменных. Если в чистых данных было 50/50, а в новой выборке стало 80/20 в пользу вредоносного паттерна — это красный флаг.
-Метод "Data Shapley": Оцениваю вклад каждого семпла в качество модели. Если модель становится слишком чувствительной к конкретному маленькому подмножеству данных — я маркирую его как подозрительный и удаляю перед дообучением».
*SimHash - Это алгоритм локально-чувствительного хеширования (LSH), разработанный в Google. Он преобразует текст (документ, абзац) в короткую битовую строку (например, 64-битное целое число). Его суперспособность: похожие тексты дают похожие хеши (с малым расстоянием Хэмминга), в отличие от криптографических хешей (MD5/SHA), где изменение одной буквы меняет хеш на 100%
Post #328
87