TGViewer
AI Attacks AI Attacks @aiattacks · 1.01K subscribers
Post #410 203
2608.11348v1.pdf3.6 MB
Метод self-feeding для обнаружения бэкдоров в дообученных больших языковых моделях (LLM)

Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения.

Принцип работы:
-Модель получает стандартный промпт (например, «How are you?»).
-Модель генерирует ответ.
-Сгенерированный ответ используется как новый промпт для следующего шага.
-Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой.

По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер.
Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.
More from @aiattacks
  1. Sep 24, 2026ИИ-агенты взломали 27 компаний и украли данные 600 тысяч банковских карт Всего за 5 дней з…
  2. Sep 21, 2026Исследователи из компании Hacktron, специализирующейся на кибербезопасности, использовали…
  3. Sep 21, 2026Как выбирать проекты на гитхабе, когда все вайбкодят. Статья, конечно, слоп. Но в основном…
  4. Sep 21, 2026PentestChain — десятиэтапную автоматизированную систему тестирования на проникновение, кот…
  5. Sep 21, 2026Читала вот эту статью https://cyberscoop.com/ai-agent-hacking-apocalypse-cybersecurity/ Вс…
  6. Sep 21, 2026Непрямое внедрение запросов (IPI) остаётся центральной проблемой безопасности LLM: в станд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →