TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #831 292
Зашифрованный блок в логе агента — не защита. Это отложенная утечка.

Когда модель думает, провайдер не показывает вам её рассуждение. Он присылает вместо него зашифрованный блок и просит вернуть этот блок обратно, если разговор продолжится. Так устроено у Anthropic, OpenAI и Google.

Александр Панфилов с соавторами (MATS, ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems) проверили, насколько блок привязан к своему разговору. Оказалось, никак. Он принимается в другой сессии, у другого пользователя и на другой модели того же провайдера.

Отсюда приём. Блок сильной модели подставляют её младшей родственнице и просят переписать содержимое дословно. Младшая отказывается, её обходят джейлбрейком — и рассуждение сильной модели читается обычным текстом. Саму сильную при этом не трогают вообще.

Вот это и есть приём, ради которого я притащил историю. Дальше авторы скачали 6 708 логов агентских сессий, которые люди сами выложили на GitHub и Hugging Face ради воспроизводимости. Из них расшифровали 315 320 блоков.

Внутри нашлось 704 чужих секрета: 62 API-ключа, 33 пароля, 24 токена доступа, 30 личных адресов почты. И главное число: 64 из них не встречаются в видимой части лога нигде. Только внутри рассуждения.

Теперь к вам. Сканер секретов читает то, что видно: текст, команды, вывод. Зашифрованный блок он видит как длинную строку мусора и проходит мимо. То есть часть утечек он не находит не потому, что плохо настроен, а потому, что смотрит не туда.

Что сделать сегодня. Поищите в репозиториях и в артефактах CI поля thinking, signature, encrypted_content. Нашли — считайте эти файлы такими же секретными, как .env, а не отладочным выводом.

Честности ради, 704 секрета на 315 320 блоков — это доли процента. Работа лежит препринтом, рецензирования не проходила. А заголовки к расшифрованным логам на сайте авторы сгенерировали Opus 5: витрину исследования про модели сделала модель.

https://stolen-thoughts.com/

Какие логи агента лежат у вас в репозитории и кто хоть раз проверял их тем же сканером, что и код?
Stolen-Thoughts Stolen Thoughts Encrypted chain-of-thought blocks returned by Anthropic, OpenAI and Google APIs are interchangeable across sessions, users and models. We exploit this to decode hidden reasoning at scale.
More from @vibecodingartem
  1. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  2. Sep 22, 2026МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забы…
  3. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
  4. Sep 21, 2026Post #991
  5. Sep 21, 2026"Воскресная Астра". Есть такое выражение - "воскресный папа". Папа приходит на 1 день, вок…
  6. Sep 21, 2026В 2000 годах в Подмосковье проводили эксперимент с агентскими системами. Собрали около 500…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →