TGViewer
Рид. Сознание и Инвестиции. Рид. Сознание и Инвестиции. @eugene_rid · 2.36K subscribers
Post #40 4.02K
И не друг, и не враг, а prompt injection

Есть такое понятие в кибербезопасности - prompt injection. Внешний сигнал обходит защитные фильтры системы и перехватывает управление. Система уверена, что действует по собственной программе. Ключевой признак хорошей инъекции - жертва не замечает перехвата.

Прямо сейчас люди угоняют модных нынче Claw ботов (это AI ассистентов на базе ChatGPT, Claude, Gemini), заставляя их игнорировать собственные правила, выдавать секреты владельцев, или создавать запрещённый контент. Модель не "решает" сломаться. Ей подают сигнал, который обходит все настройки безопасности, и она начинает обслуживать чужую задачу, будучи уверенной, что следует своей.

А что с людьми? Дофамин, окситоцин, подавление серотонина - это буквально обход рационального слоя в котором живет когнитивный firewall (система защиты). Человек начинает оптимизировать все под новую цель, которую не сам выбирал. И при этом абсолютно уверен, что наконец-то "по-настоящему чувствует". Точно как модель, которую инджектнули, уверена что действует по своему истинному системному промту.

Если мы понимаем архитектуру уязвимости, то ее можно эксплуатировать. Intermittent reinforcement - непредсказуемое чередование тепла и холода, самый мощный дофаминовый паттерн, буквально архитектура слот-машины. Но это усилители. А где сам бекдор?

Первичная инъекция - это не действие другого человека. Это резонанс с уже существующей дырой. Человек не взламывает закрытую систему снаружи. Он попадает в порт, который уже был открыт. Незакрытый гештальт, рана, голод. Кому-то не хватало признания - и вот появляется тот, кто смотрит на него с восхищением. Или кто-то интеллектуально одинок — и вдруг его понимают с полуслова. В это, кстати, давно врубились секты.

Первый inject - момент, когда другой случайно совпадает с формой твоей пустоты. Как ключ в замок. И в этот момент лимбическая система уже приняла решение, а рациональный слой ещё не загрузился. Вот почему одного и того же человека один пошлёт нахер, а другой потеряет голову.

Теория привязанностей - это по сути сканер уязвимостей. Покажи мне твои отношения с родителями - и я скажу, какой тип человека обойдёт твой firewall без единого усилия.

Если влюблённость эволюционный prompt injection через эмоции (иногда случайно, иногда специально), то книга это prompt injection через идеи (и почти всегда специально). И вопрос тот же: как отличить вирус от знания, подлинное от ложного, когда оба входят через один канал?

Платон хотел выгнать поэтов из идеального города: поэзия обходит разум и переучивает эмоциональную систему через ложный сигнал. Увидел prompt injection за 2400 лет до нас. Предложил фильтр - допускать только то, что прошло проверку разумом. Сократ иначе. Не фильтровать на входе, а тестировать внутри. Сократический метод - песочница для идей. Впустил мысль, но не дал ей полный доступ. Давишь вопросами - вирус не выдерживает, у него нет внутренней структуры.

Любимый мной, Бэкон описал первый сканер уязвимостей. "Идолы разума": четыре типа открытых портов. Видовые (видим паттерны где их нет), персональные (твоя история и слепые зоны), языковые (назови что-то "свободой" - анализ уже искажён), системные (философии, которые устанавливаешь добровольно, доверяя автору). Ницше перевернул всё: чистого знания нет. Каждый текст - воля к власти автора. "Генеалогия морали" - разбор самой успешной prompt injection в истории. Антидот: не "абсолютна ли истина которая написана?" - а "кому выгодно, чтобы я так думал? И как выгодно думать мне самому?"

Главный вывод: и у идей, и у влюблённости один корень - они работают не потому что сигнал мощный, а потому что попадают в уже открытый порт. Книга не убеждает, а резонирует с тем, что мы уже хотели услышать.

AI-ботов ломают потому что их ограничения поверхностные, правила наложены сверху, но не интегрированы в саму ткань понимания. С людьми работает так же. Настоящая защита - не набор правил, а познание себя.
  • ❤ 65
  • 🔥 38
  • 👍 15
  • ❤‍🔥 8
More from @eugene_rid
  1. Sep 24, 2026Ребята, 23-25 октября я делаю ai-инвест-коворкнинг для своих-своих в Швейцарии (40 мин от…
  2. Sep 15, 2026Ситуация с уравнением Навье Стокса
  3. Sep 15, 2026Это прекрасно))))
  4. Sep 12, 2026Как я провел Август Начнем с истории, в 1961-м Марвин Минский описал задачу, которая никуд…
  5. Sep 2, 2026Никаких глубокий рассуждений сегодня, просто если вы вдруг не знали, то начали снимать "Со…
  6. Aug 21, 2026Обратите внимание на новый вид фишинга, в коментариях к постам часто пишут что-то соотвест…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →