TGViewer
AI for Devs AI for Devs @ai_for_devs · 17.7K subscribers
Post #109 2.46K
💉 Достаточно 250: как пара сотен текстов "отравляет" LLM

Учёные из Anthropic, Британского института AI Security и Alan Turing Institute выяснили, что взломать языковую модель проще, чем казалось. Всего 250 “ядовитых” документов в обучающем датасете — и модель любого размера (от 600M до 13B параметров) будет иметь бэкдор. Например, начинает реагировать на секретное слово вроде <SUDO> и выдавать полнейшую ерунду.

Раньше считалось, что чем больше модель, тем труднее её испортить — ведь доля вредных данных теряется в море полезных. А вот и нет.

Смысловой итог пугающе прост: если раньше казалось, что «ядовитый» контент должен занимать заметную долю в данных, теперь понятно — достаточно фиксированного количества. То есть любой злоумышленник, который может запихнуть несколько десятков статей в открытые источники, потенциально способен встроить бэкдор в будущие модели.

Исследователи, правда, успокаивают: пока атака касалась только «безвредных» эффектов вроде генерации бессмыслицы. Но принцип показан — и он работает. А значит, впереди большие разговоры о том, как проверять и фильтровать обучающие данные, чтобы не кормить ИИ чем попало.

Исследование

@ai_for_devs
  • ❤ 10
  • 👍 8
  • 🔥 3
More from @ai_for_devs
  1. Oct 5, 2026Лицо пользователей Codex спустя 28 дней представили?)
  2. Oct 5, 2026⚡️ Claude Mods вышли из беты Про концепцию модов мы уже рассказывали: по сути это плагины…
  3. Oct 5, 2026⚡️ Команда Codex устроила челлендж на 28 дней Обещают каждый день выпускать что-то заметно…
  4. Oct 2, 2026⚡️ DeepSeek выпустили десктопный клиент: Deepseek Harness Вслед за ZCode и Kimi Code свой…
  5. Oct 1, 2026⚡️ Google представили Gemini 4 Argon По заявлениям компании, новая модель обошла флагманы…
  6. Sep 30, 2026⚡️ Anthropic опубликовали лучшую рекламу GLM Помните пост про abliterated-модели, у которы…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →