TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.6K subscribers
Post #5705 4.18K
Исследователи UC Berkeley показали новую проблему безопасности AI-агентов: иногда скрытый навык можно почти восстановить, вообще не видя его системный промпт, SKILL.md или внутренние файлы.

В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.

Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.

Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.

То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.

Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:

- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов

Особенно важно для компаний, которые продают закрытые agent skills как сервис.

https://arxiv.org/abs/2608.26733
  • 👍 8
  • 🔥 8
  • ❤ 3
More from @data_analysis_ml
  1. Sep 22, 2026⚡️ Claude сам сгенерировал вредоносную инструкцию При тестировании ранней версии Claude Op…
  2. Sep 22, 2026⚡️OpenAI выпустила GPT-6 Sol и GPT-6 Luna Семейство GPT-6 расширилось сразу двумя новыми м…
  3. Sep 22, 2026LFM2.5 вошла в лидеры локальных моделей для смартфонов 📱 Artificial Analysis протестирова…
  4. Sep 22, 2026🚨 Alibaba представила один из самых агрессивных планов развития ИИ Главное: • Qwen 4 уже…
  5. Sep 22, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  6. Sep 22, 2026Xiaomi представила MiMo-V2.6 с открытыми весами 👀 В семейство вошли две MoE-модели: - Fla…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →