TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #147 501
ChatGPT Выдаёт Секреты👮‍♂

💡Исследователи из Google DeepMind, Open AI, ETH Zurich, McGill University и University of Washington разработали новую атаку для извлечения ключевой архитектурной информации из проприетарных больших языковых моделей (LLM) таких как ChatGPT и Google PaLM-2.

💻 Исследование демонстрирует, как злоумышленники могут извлечь скрытые данные из чат-бота, работающего на базе LLM, чтобы полностью дублировать или украсть его функциональность. Атака, описанная в техническом отчете, выявила слабые места, с которыми создателям инструментов ИИ  предстоит бороться в ближайшей перспективе.

🎯 Извлечение Скрытых Данных
Информация о интерфейсах прикладного программирования позволяют разработчикам интегрировать инструменты с ИИ в свои собственные приложения, продукты и услуги. API позволяют использовать языковые модели для ряда use case, например для создания виртуальных ассистентов и чат-ботов.

💶 Исследователи из DeepMind, OpenAI хотели узнать, какую информацию они могли бы извлечь из моделей ИИ, делая запросы к API.

🪜 Атака "Сверху-Вниз"
Информация в последнем слое модели может включать важные подсказки о том, как модель обрабатывает входные данные, преобразует их и выполняет сложную последовательность процессов для генерации ответа.

Успешные атаки на этом уровне могут раскрыть "ширину трансформаторной модели, которая часто коррелирует с общим количеством ее параметров.


Такой подход немного снижает степень того, что модель является полностью 'черным ящиком'


За менее чем 20 долларов США наша атака извлекает полную матрицу проекции языковых моделей.


⚔ Факт того, что вообще возможно украсть какие-либо параметры производственной модели, удивителен и вызывает большие опасения.

😱 Ранее в этом месяце, например, исследователи из HiddenLayer выпустили отчет, в котором описали, как они смогли добиться от Google Gemini неправильного поведения различными способами, отправив ему тщательно структурированные запросы. Stay secure and read SecureTechTalks🛡

#ChatGPT #AI
#SecureTechTalks
More from @securetechtalks
  1. Oct 9, 2026🧨 Haiku 5.5 уже умеет получать RCE в Chrome Anthropic выпустила Claude Haiku 5.5. Формаль…
  2. Oct 8, 2026🧨 Copilot CLI слил .env за 28 секунд через зашифрованный prompt injection Исследователи A…
  3. Oct 7, 2026🧨 AI Agent Gateway: шлюз, чтобы агент не таскал ключи по всем MCP Tuskira открыла исходны…
  4. Oct 6, 2026🧨 Два безопасных Skill могут собрать RCE Новое исследование и новая проблема: каждый навы…
  5. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  6. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →