TGViewer
AI Coder AI Coder @ai_coder_news · 539 subscribers
Post #586 443
Оказывается, hidden reasoning у frontier-моделей можно было буквально украсть за два API-вызова 😨

Очень крутая работа Stolen Thoughts про уязвимость reasoning API у OpenAI, Anthropic и Google.

Механика, по сути, гениально простая.

Когда reasoning-модель думает, полный Chain-of-Thought пользователю не показывают. Но чтобы продолжать диалог, API возвращает клиенту зашифрованный reasoning block, который потом можно отправить обратно.

Проблема оказалась в том, что эти блоки были недостаточно привязаны к конкретной модели, сессии и пользователю.

Исследователи брали encrypted reasoning от сильной модели — условно Opus — и передавали его более слабой модели того же провайдера. Слабую модель уже гораздо проще jailbreak'нуть и попросить вывести содержимое reasoning.

И она фактически становилась decryption oracle и печатала reasoning сильной модели plaintext'ом.

Причем показали это для Anthropic, OpenAI и Google.

Самое неприятное даже не кража интеллектуальной собственности модели.

Исследователи собрали 6 708 публичных agent trajectories с GitHub и Hugging Face, внутри которых остались encrypted reasoning blocks, и восстановили 315 320 reasoning traces.

Там нашли 704 уникальных sensitive artifacts: API keys, passwords, access tokens, email, внутренние URL и другую приватную информацию.

Причем часть данных существовала только внутри hidden reasoning и вообще никогда не появлялась в видимом ответе модели.

То есть разработчик мог посмотреть лог, решить:

«Ну тут ничего секретного нет»,

запушить trajectory на GitHub — а внутри encrypted blob лежал пароль или API key.

Еще прикольный эксперимент сделали с Kimi-K3: ей подсовывали всего первые ~1% reasoning от Opus 4.8, и даже такого маленького seed хватало, чтобы итоговый ответ Kimi начинал двигаться в сторону формулировок Opus. То есть reasoning реально является очень мощным hidden state, который управляет дальнейшей генерацией.

И вывод для всей агентской разработки:

encrypted ≠ safe.

Если opaque blob можно перенести в другой security context, а сервер потом сам его расшифрует и отдаст модели — это, по сути, bearer token с огромным количеством скрытого контекста внутри.

После responsible disclosure провайдеры дыру уже прикрыли: атаки из paper сейчас не воспроизводятся. Reasoning blocks стали жестче привязывать к модели и контексту сессии.

Но сама работа очень хорошая.

Мы всё больше строим agent infrastructure вокруг hidden state моделей — reasoning, memory, compaction, checkpoints — и такие объекты надо начинать воспринимать ровно как credentials и secrets, а не как какие-то безобидные технические поля API.

stolen-thoughts.com
  • 🔥 13
  • 👍 5
  • ❤ 2
More from @ai_coder_news
  1. Sep 18, 2026⚡ Собрал смарт-роутинг для Claude Code: тяжёлые задачи — на GLM-4.5+, рутина — на флеш Под…
  2. Sep 16, 2026Я перестал давать Astra писать код. И дело не в том, что она плохо это делает 🙂 Довёл до…
  3. Sep 14, 2026Как я использую OKF в своих проектах? Я запускаю этот промпт и дальше агент читает правила…
  4. Sep 14, 2026🧠 Google OKF vs OpenViking: какую память делать своим агентам? Начал разбираться с Open K…
  5. Sep 7, 2026Spotify показал, как сократить расход Claude Code примерно на 90% — и идея тут на самом де…
  6. Sep 4, 2026OpenAI будет давать full reset за каждый день без Astra. Вот до чего дошла гонка за AGI 🤯…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →