🧨 Зашифрованные мысли LLM не такие уж секретные
Разработчики Anthropic, OpenAI и Google специально прячут chain-of-thought. Пользователь получает только краткое summary, а полное reasoning API возвращает в виде зашифрованного блока, который клиент должен передать обратно при следующем запросе.
Звучит безопасно? Спойлер - нет.
Исследователи из Tübingen, Max Planck, MATS и Snyk показали, что если взять такой блок от сильной модели и передать его более слабой модели того же провайдера, слабую модель можно заставить расшифровать и вывести исходный reasoning практически дословно.
⚙️ В чём проблема?
Уязвимость оказалась архитектурной. Reasoning-блоки были совместимы между разными сессиями, пользователями и моделями внутри одной экосистемы.
Схема выглядит так:
сильная модель → encrypted reasoning → слабая модель → plaintext reasoning
Более слабая модель становится дешёвым «дешифратором», потому что у неё менее строгие защитные настройки.
🧠 Дальше больше
Учёные скачали 315 320 зашифрованных reasoning-блоков из публичных репозиториев и смогли восстановить из них:
🔹 367 PII-артефактов;
🔹 182 credentials.
То есть разработчик мог спокойно опубликовать лог, увидеть в нём набор бессмысленных символов и фактически выложить вместе с ним пароль или API credential.
Стоит учесть, что reasoning может содержать информацию, которой вообще нет в видимой части сессии.
🔥 Более опасный сценарий
Исследователи показали, что этот же механизм можно использовать и в обратную сторону. Не извлекать скрытый prompt, а спрятать вредоносную инструкцию внутри reasoning-блока.
Видимый лог выглядит нормально. Человек ничего подозрительного не замечает, но другой агент, получив этот блок как часть истории предыдущего запуска, может прочитать встроенную инструкцию как собственное прошлое состояние.
Получается новый вариант invisible prompt injection, который особенно опасен для публичных коллекций agent trajectories.
🧨 Причем тут Kimi?
Авторы отдельно сравнили скрытые reasoning-трейсы Claude Opus 4.8 и GPT-5.6 Sol с несколькими open-weight моделями.
У Kimi K3 обнаружились необычно сильные совпадения. Это выглядит как возможный след distillation, но авторы подчёркивают, что эксперимент не доказывает, что Kimi действительно обучалась на украденных reasoning-трейсах.
🔗 Исследование: https://arxiv.org/abs/2608.09867
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #ChainOfThought #AgenticAI #AISecurity #PromptInjection #DataLeak #ModelSecurity #SecureTechTalks
Post #831
178

- 👍 1