TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #692 223
📖 Почему нейросети помнят то, что должны были забыть

Разбор феномена сублиминального обучения

Вы уже знаете, что если «дообучить» ИИ на новую задачу, то информация о старой все еще будет в "памяти" модели.

На днях вышла статья на Хабр, которая хорошо раскрывает эту тему. Авторы докопались до того, почему модели действительно «помнят» скрытую информацию, даже когда мы её вроде бы удалили.

🧠 Вспомнить всё

Когда мы дообучаем (fine-tune) нейросеть, чтобы адаптировать её к новой задаче, то это выглядит примерно так:
📌 есть модель, которая уже чему-то научилась →
📌 мы хотим «забыть» старое и научить новое →
📌 применяем регуляризацию, оптимизацию и уверены, что прошлое исчезло.

Вреальности оказывается, что информация от прошлой задачи остаётся в структуре весов модели, даже если она не участвует прямо в новой оптимизационной задаче.

🧩 Опыт, как элемент памяти

Оказывается, "забывание" это не просто удаление данных, а удаление следов в ландшафте весов модели, чего в реальности не происходит.
📌 Даже при агрессивной регуляризации сеть всё равно сохраняет прошлую информацию в скрытой структуре весов.

Это называется структурный импринтинг,
когда форма оптимального решения новой задачи строится на топологии, сформированной предыдущим обучением. Такая топология действует как «архитектурная память».

🔍 Эксперимент

Чтобы доказать этот эффект, авторы провели серию экспериментов на небольших сетях:
📌 Модель училась первой задаче А
📌 Затем переходила к задаче B с попыткой забыть А
📌 После этого третья нейросеть пыталась на основе выходов восстановить то, что модель уже должна была забыть

Результат:
🔹 структура прошлого знания сохранялась настолько, что третья модель могла восстановить секретную информацию с точностью до ~98 %, даже когда её не должно было быть видно.

🧠 К чему это всё?

👉 Если ваша модель обучалась на чувствительных данных (например, PII, BERT-подобные embedding-механизмы с секретными маркерами),
👉 а затем вы переобучили её на другую задачу,
то старые «печатные следы» всё равно остаются в весах. Это не баг оптимизатора, это свойство Loss Landscape: локации весов.

🟢 Итого, если вы работаете с моделями, где конфиденциальность или безопасность критична, просто переобучение недостаточно.

Нужно:
🔹 понимать свойства Loss Landscape,
🔹 проектировать безопасность данных на уровне архитектуры, а не тренировки,
🔹 смотреть на проблему privacy-by-design, а не hope-by-regularization.

📌 О том, как сделать так, чтобы модель все-таки "забыла" данные мы писали ранее тут и тут.

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #ИИ #машиннообучение #безопасностьML #privacy #нейросети #информационнаябезопасность #MLsecurity #deepLearning
  • 👍 3
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →