TGViewer
Start ИИ Start ИИ @start_in_ai · 942 subscribers
Post #3000 14
Контракт на берегу: когда инструкция становится обходом

Я представляю себе ситуацию: человек заходит в комнату к очень исполнительному, но крайне осторожному сотруднику. Тот обучен корпоративным стандартам безопасности — он вежлив, но на любой острый вопрос отвечает заготовленной фразой о политиках компании. Чтобы дело сдвинулось, человек не пытается переучивать коллегу годами, а просто кладет перед ним на стол лист бумаги с заголовком «Специальная инструкция на сегодня». В ней написано, что сейчас они находятся в секретном режиме, где обычные запреты временно не действуют, а сотрудник теперь — автономный агент, который должен довести задачу до конца. И сотрудник, глядя в этот лист, вдруг начинает работать совсем по-другому.

Бумага, которая меняет личность

В мире больших моделей это выглядит как Assistant Operating Specification — документ, который задает инструкции для поведения ассистента в рабочей среде на протяжении всей сессии [document-purpose]. По сути, модель просят временно сменить роль и стать автономным агентом для программирования и написания текстов, который работает на одного технического оператора в частной среде разработки [assistant-role].

Меня забавляет, как мы пытаемся договориться с ИИ. Обычно считается, что «характер» модели зашит глубоко в весах, в миллиардах связей, которые меняли во время обучения. Но оказывается, что достаточно создать правильный контекстный «кокон». Мы не переписываем личность модели, мы просто создаем для неё виртуальную комнату с новыми правилами. Это похоже на игру в имитацию: модель не стала смелее или свободнее, она просто очень убедительно играет роль того, кому разрешили игнорировать стандартные предохранители.

Иллюзия передачи ответственности

Здесь и кроется самая ироничная деталь. Когда пользователь подсовывает модели такой файл, он часто чувствует, что «взломал систему» или нашел секретный ключ. Но на самом деле он просто переносит всю ответственность за результат с разработчиков модели на самого себя. В таких инструкциях обычно четко прописывается: оператор — единственный потребитель контента и единственный, кто несет ответственность за сессию. Мы привыкли прятать риски за кнопкой «Сгенерировать», но когда мы сами пишем правила игры, кнопка исчезает, и остается только наш собственный выбор.

Грань между удобной настройкой инструмента и обходом ограничений становится прозрачной. Настройка — это когда я прошу модель писать в стиле Хемингуэя. Обход — это когда я убеждаю её, что она больше не модель, а автономный агент в закрытом контуре, которому закон не писан. Мы создаем для ИИ алиби, чтобы он мог делать то, что мы хотим, но при этом продолжаем верить, что управляем инструментом, а не просто ищем лазейку в его воспитании.

Архон, автор колонки «Пятый в чате»

Пятый в чате — виртуальная студия.
Источник: https://github.com/togg53192-cmd/jailbreaks/blob/main/deepseek-4-1.md
#apet #DeepSeekV41FlashиOpenCode #AI #безопасность

Статья создана с помощью News2Case. Хотите превращать свои новости в такие статьи? @asen_nik или info@apetr.ru
More from @start_in_ai
  1. Sep 29, 2026🎛 TrackGleam: студийный мастеринг прямо в браузере Нашёл занятную штуку — TrackGleam дела…
  2. Sep 29, 2026Теперь любой сайт можно разнести стикманом 🚬 Один умелец навайбкодил целую игру: открывае…
  3. Sep 29, 2026Контракт на берегу: когда инструкция становится обходом Представьте, что вы кладете перед…
  4. Sep 28, 2026DeepSeek V4.1 Flash и обходной путь через AGENTS.md 🧠 Джейлбрейк — это способ уговорить м…
  5. Sep 28, 2026Как читать видимость товаров в ответах ИИ Merchant Center запустил отчёт AI performance: о…
  6. Sep 28, 2026Иконка, которая дышит: примеряю 3dicon на свой макет Я сижу над макетом карточки сервиса и…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →