TGViewer
Codeby Codeby @codeby_sec · 37K subscribers
Post #10390 2.71K
Скрытые мысли ИИ можно украсть через API — и провайдеры сами помогают

Когда reasoning-модель вроде o3 или Claude «думает» перед ответом, её внутренние рассуждения спрятаны от пользователя. OpenAI, Google, Anthropic вложили месяцы вычислений в эти reasoning-цепочки — стратегии декомпозиции, паттерны самопроверки, внутренние эвристики. Это и есть главная интеллектуальная собственность.

Но вот парадокс: сами API выдают достаточно метаданных, чтобы эти рассуждения реконструировать.

🔎Свежий препринт 2025 года описывает класс атак под названием EchoCoT — извлечение скрытого chain-of-thought из закрытых моделей. Не jailbreak, не обход safety-фильтров, а именно кража того, как модель рассуждает. И работает это пугающе просто.

Что отдаёт API при обычном запросе? Четыре side-channel сигнала:

⏺️Поле reasoning_tokens — точное число скрытых токенов рассуждений. Текста нет, но видно, сколько модель «думала»
⏺️TTFT (задержка до первого токена) — коррелирует с длиной скрытого CoT. Замеряешь через time.monotonic() в streaming-режиме — получаешь ещё один канал утечки
⏺️Streaming-паттерны — модель после длинного скрытого reasoning выдаёт ответ характерными «рывками», отличимыми от обычной генерации
⏺️Разница между total_tokens и суммой видимых токенов — косвенно показывает объём скрытого reasoning

Зачем это атакующему? Три вектора ущерба.

Первый — дистилляция. Восстановленные reasoning-траектории становятся готовыми обучающими данными. Берёшь дешёвую модель, скармливаешь ей чужие паттерны рассуждений — получаешь клон за копейки. По данным ещё одного препринта 2025 года, для экстракции проприетарного поведения агента хватает буквально нескольких API-взаимодействий.

Второй — усиление jailbreak'ов. Если ты знаешь, как модель рассуждает о safety (какие шаги проходит перед отказом, какие триггеры вызывают refusal), можно конструировать точечные обходы. В работе CoT Hijacking показано: средние слои трансформера кодируют силу safety-проверки, поздние — результат верификации. Зная структуру, атакующий целенаправленно «разбавляет» safety-сигнал.

Третий — утечка системной логики. OWASP уже классифицирует это как LLM07:2025. Скрытый CoT по сути — расширенный системный промпт: бизнес-логика обработки, правила отказа, стратегии решения.

🎇Интересная деталь — разные модели уязвимы по-разному. DeepSeek R1 вообще выкладывает CoT в открытом виде в тегах <think> — красть нечего, зато удобно как эталон для верификации атак на закрытые модели. OpenAI o-серия полностью скрывает текст, но отдаёт метаданные. Claude с extended thinking — посередине: суммаризация reasoning выдаёт стилистические маркеры для реконструкции.

Ни один крупный провайдер пока не отключает reasoning-метаданные — потому что клиентам они нужны для бюджетирования. Безопасность буквально проигрывает удобству.

Полный разбор таксономии атак, механики EchoCoT и практической методологии воспроизведения — в статье на форуме⬇

https://codeby.net/threads/echocot-izvlecheniye-tsepochek-rassuzhdenii-llm-iz-black-box-reasoning-modelei-cherez-api.95271/
  • ❤ 4
  • 👍 4
  • 🔥 4
More from @codeby_sec
  1. Sep 23, 2026🌐На мировую арену Lazarus вышли в 2014 году после атаки на Sony Pictures Entertainment. П…
  2. Sep 23, 2026Codeby pinned a photo
  3. Sep 23, 2026От теории к реальным задачам: как учат веб-пентесту в Codeby 🚗 Можно знать OWASP Top 10,…
  4. Sep 23, 2026Ваш терминал выполняет чужие команды — и вы этого не видите Представьте: вы читаете логи н…
  5. Sep 22, 2026Post #10458
  6. Sep 22, 2026https://youtube.com/shorts/B-JlepDLJP0?feature=share Идеальный курс по ИБ MS SQL, ADCS, AD…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →