Исследователи заявили об утечке скрытых рассуждений LLM
Авторы нового препринта описали возможную уязвимость в API крупных ИИ-провайдеров. По их данным, зашифрованный reasoning-трейс одной модели можно передать менее защищённой модели того же провайдера и получить его в открытом виде.
Исследователи заявляют, что продемонстрировали подход в системах Anthropic, OpenAI и Google. Из 315 320 блоков, собранных в публичных репозиториях, они, по собственным подсчётам, извлекли 367 фрагментов персональных данных и 182 секрета для доступа.
Работа пока не прошла рецензирование. Независимого подтверждения результатов и данных о текущем статусе уязвимости нет. Публиковать журналы API и сессий без проверки их содержимого рискованно. #AIsecurity
Источник: arXiv
Источник: оригинальная публикация
CLODEx
Post #264
604
