🧨 Можно узнать, какие данные LLM запомнила после обучения
Исследователи представили JUMP, метод, который позволяет определить, попал ли конкретный текст в обучающий датасет diffusion модели.
⚙️ Что такое diffusion LLM?
ChatGPT генерирует текст последовательно, токен за токеном. Diffusion модель может получить текст с пропущенными фрагментами и восстанавливать несколько токенов одновременно.
Эту особенность авторы превратили в инструмент для privacy атак.
🧠 Как работает JUMP
Исследователь берёт исходную модель и её версию после fine tuning. Затем скрывает отдельные токены в проверяемом тексте и смотрит, насколько хорошо обе модели их восстанавливают.
Если после обучения модель стала заметно лучше восстанавливать конкретный фрагмент, это может указывать на его присутствие в обучающих данных.
JUMP показал свою эффективность в цифрах:
🔹 требуется всего 3 запуска;
🔹 ROC AUC для модели LLaDA 8B вырос с 0,819 до 0,902;
🔹 для Dream 7B модели с 0,851 до 0,942.
🛡️ Проверяем данные
Fine tuning на приватных данных может оставить в модели измеримый след. Теперь для diffusion LLM появляется практический способ проверить, какие данные модель могла запомнить во время обучения.
🔗 Исследование: https://arxiv.org/abs/2607.16207
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #DiffusionLLM #AISecurity #Privacy #FineTuning #MembershipInference #MachineLearning #SecureTechTalks
Post #841
149

- 👍 1