TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #340 191
🧠 Как удалить нежелательные знания из языковых моделей?

Исследователи из Northeastern University разработали новый метод под названием Erasure of Language Memory (ELM), который позволяет языковым моделям «разучивать» определенные концепции, не теряя при этом своих ключевых способностей.

💻 Представьте, что вы хотите, чтобы модель забыла, как генерировать информацию по опасным темам (например, как создать биологическое оружие). При этом важно, чтобы модель не выдавала бессвязный текст и продолжала правильно работать с другими задачами.

🔍 ELM использует специальные методы низкорангового обновления модели, которые изменяют вероятности выдачи определённых текстов. Таким образом, модель теряет «память» о нежелательных темах, сохраняя свою общую функциональность.

🔥 Данный метод уже показал свою эффективность в тестах кибербезопасности. Он сохраняет высокую точность на безопасных темах, но выдаёт случайные ответы на вопросы по удалённым концепциям.

📊 Преимущества ELM:

- Полное удаление нежелательных знаний (например, о вредоносных концепциях).
- Сохранение общей производительности модели.
- Устойчивость к атакам злоумышленников.

Разработанный подход открывает новые горизонты в безопасности и контроле языковых моделей, снижая риск генерации опасной информации.

🔗 Подробнее о ELM можно прочитать в полном тексте исследования.

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #кибербезопасность #AI #LLM #безопасность
  • 👍 1
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →