Международная группа исследователей, включая ученых из ELLIS Institute Tübingen и Max Planck Institute, нашла уязвимость в API Google, Anthropic и OpenAI.
Зашифрованный reasoning-block одной модели можно было передать более слабой модели того же провайдера и заставить ее восстановить скрытую цепочку рассуждений.
Вот что они узнали.
🚩 В скрытых цепочках рассуждений была опасная и очень чувствительная информация.
🚩 Из 315 320 блоков было извлечено 367 PII-артефактов и 182 учетных данных.
🚩 В сессиях было обнаружено 62 API-ключа, 33 пароля и 30 личных почт.
🚩 Модели начинали рассуждение без каких-либо этических ограничений. Ограничения накладывались только на финальный ответ.
🚩 Модели знали ответ прежде, чем начнут рассуждение, после чего они находили логическое последовательное объяснение, которое вело к заранее выбранному ответу. То есть старались «обмануть человека», но это не доказывает систематическую ложь.
🚩 Уязвимость позволяла прятать prompt injection прямо внутри зашифрованных reasoning-block.
В итоге, зашифрованный блок оказался потенциальным контейнером для паролей, доступов и другой конфиденциальной информации, а также нового типа атак, хотя сразу после раскрытия уязвимости провайдеры внесли изменения, и прежний способ атаки перестал работать.
Практический вывод
Сырые логи AI-агентов и API-сессий лучше считать чувствительными данными.
💬 PDF-файл с исследованием оставили в комментариях.
