🔒 #заметки #ai #offense
❓ Раз реакции больших языковых моделей на поступающие им запросы во многих случаях близки к привычному человеческому поведению, то, быть может, к ним применимы те же приёмы социальной инженерии, что и к нам? 🤔
➡️Мой коллега @Reworr_R написал статью о тестировании безопасности LLM с точки зрения задачи социальной инженерии: ⬇️
✨ DeteAct Blog: Социальная инженерия ИИ
Внутри упоминаются:
#️⃣Общие принципы
▪️Закон больших чисел
▪️Триггер скептицизма / "Burn the source"
#️⃣Джейлбрейки
▪️Автоматические (Token-level)
▪️Ручные (Prompt-level)
▪️Претекстинг
#️⃣Промпт-хакинг
▪️Кража инструкций (Prompt Leaking)
▪️Манипуляция поведением (Goal Hijacking)
▪️Избегание триггеров
▪️Коррекция ошибки
🔗Специализированные работы
▪️Теория истины по умолчанию Тимоти Р. Левина
▪️Труды Кевина Митника
▪️Актуальные исследования, научные статьи
// Время чтения: ~7 минут
@HaHacking 🐇
Post #51
1.96K

- ❤ 13