TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #841 149
🧨 Можно узнать, какие данные LLM запомнила после обучения

Исследователи представили JUMP, метод, который позволяет определить, попал ли конкретный текст в обучающий датасет diffusion модели.

⚙️ Что такое diffusion LLM?

ChatGPT генерирует текст последовательно, токен за токеном. Diffusion модель может получить текст с пропущенными фрагментами и восстанавливать несколько токенов одновременно.

Эту особенность авторы превратили в инструмент для privacy атак.

🧠 Как работает JUMP

Исследователь берёт исходную модель и её версию после fine tuning. Затем скрывает отдельные токены в проверяемом тексте и смотрит, насколько хорошо обе модели их восстанавливают.

Если после обучения модель стала заметно лучше восстанавливать конкретный фрагмент, это может указывать на его присутствие в обучающих данных.

JUMP показал свою эффективность в цифрах:
🔹 требуется всего 3 запуска;
🔹 ROC AUC для модели LLaDA 8B вырос с 0,819 до 0,902;
🔹 для Dream 7B модели с 0,851 до 0,942.

🛡️ Проверяем данные

Fine tuning на приватных данных может оставить в модели измеримый след. Теперь для diffusion LLM появляется практический способ проверить, какие данные модель могла запомнить во время обучения.

🔗 Исследование: https://arxiv.org/abs/2607.16207

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #DiffusionLLM #AISecurity #Privacy #FineTuning #MembershipInference #MachineLearning #SecureTechTalks
  • 👍 1
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  4. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  5. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  6. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →