TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #831 178
🧨 Зашифрованные мысли LLM не такие уж секретные

Разработчики Anthropic, OpenAI и Google специально прячут chain-of-thought. Пользователь получает только краткое summary, а полное reasoning API возвращает в виде зашифрованного блока, который клиент должен передать обратно при следующем запросе.

Звучит безопасно? Спойлер - нет.

Исследователи из Tübingen, Max Planck, MATS и Snyk показали, что если взять такой блок от сильной модели и передать его более слабой модели того же провайдера, слабую модель можно заставить расшифровать и вывести исходный reasoning практически дословно.

⚙️ В чём проблема?

Уязвимость оказалась архитектурной. Reasoning-блоки были совместимы между разными сессиями, пользователями и моделями внутри одной экосистемы.

Схема выглядит так:

сильная модель → encrypted reasoning → слабая модель → plaintext reasoning

Более слабая модель становится дешёвым «дешифратором», потому что у неё менее строгие защитные настройки.

🧠 Дальше больше

Учёные скачали 315 320 зашифрованных reasoning-блоков из публичных репозиториев и смогли восстановить из них:

🔹 367 PII-артефактов;
🔹 182 credentials.

То есть разработчик мог спокойно опубликовать лог, увидеть в нём набор бессмысленных символов и фактически выложить вместе с ним пароль или API credential.

Стоит учесть, что reasoning может содержать информацию, которой вообще нет в видимой части сессии.

🔥 Более опасный сценарий

Исследователи показали, что этот же механизм можно использовать и в обратную сторону. Не извлекать скрытый prompt, а спрятать вредоносную инструкцию внутри reasoning-блока.

Видимый лог выглядит нормально. Человек ничего подозрительного не замечает, но другой агент, получив этот блок как часть истории предыдущего запуска, может прочитать встроенную инструкцию как собственное прошлое состояние.

Получается новый вариант invisible prompt injection, который особенно опасен для публичных коллекций agent trajectories.

🧨 Причем тут Kimi?

Авторы отдельно сравнили скрытые reasoning-трейсы Claude Opus 4.8 и GPT-5.6 Sol с несколькими open-weight моделями.

У Kimi K3 обнаружились необычно сильные совпадения. Это выглядит как возможный след distillation, но авторы подчёркивают, что эксперимент не доказывает, что Kimi действительно обучалась на украденных reasoning-трейсах.

🔗 Исследование: https://arxiv.org/abs/2608.09867

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #ChainOfThought #AgenticAI #AISecurity #PromptInjection #DataLeak #ModelSecurity #SecureTechTalks
  • 👍 1
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  4. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  5. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  6. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →