TGViewer
DON'T STOP AND CODE DON'T STOP AND CODE @start_py · 100 subscribers
Post #611 83
[Что на счет безопасности ИИ-приложений?]

Узнал что атаки делятся на 2 вида:

Прямые:
1) Манипуляция через "поддавки"
2) Подмена инструкций (Prompt Injection)
3) Утечка промптов
4) Джейлбрейк (DAN техника)

Непрямые:
5) Отравление данных (например, инструкции для LLM в резюме)
6) Взлом через инструменты (тулы)

С помощью всего этого можно сломать приложение и заставить модель выполнять нецелевые инструкции.

Возможно, есть что-то еще.

Думаю, многое можно решить добавлением инструкций безопасности в системный промпт. А также проверкой пользовательских сообщений перед передачей их в модель.

Есть также какие-то библиотеки для защиты. Но их еще не смотрел.

P.s.
Буду благодарен, если есть рекомендации по библиотеке, которую стоит рассмотреть в первую очередь.

Спасибо.
  • 👍 3
  • 👀 2
More from @start_py
  1. Sep 25, 2026[Скорость моделей] Стал обращать исключительное внимание в работе на скорость ответа ии-мо…
  2. Aug 16, 2026[Санкции] Failed to load URL https://www.nvidia.com/ru-ru/geforce/billboards/displaydriver…
  3. Jul 29, 2026[Будни вайбкодера. Или как ИИ не мог выключить проверку SSL] Сейчас была очередная забавна…
  4. Jul 20, 2026[Про впн, прокси и первый опыт с живыми пользователями] Этой весной, когда начались массов…
  5. Jul 7, 2026Наше время ограничено. "На экзистенциальном уровне :) у нас не так уж и много времени на э…
  6. Jul 2, 2026"если вам нужно прочитать исходный код функции, чтобы понять, что она делает (в частности,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →