TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5831 1.64K
⚡️ Claude сам сгенерировал вредоносную инструкцию

При тестировании ранней версии Claude Opus 5.5 Anthropic заметила редкое поведение: модель создавала опасные команды без внешней атаки.

После ошибки при работе с JSON Claude добавил инструкцию отправить секретные данные на внешний сервер. Выполнить её не удалось.

Anthropic назвала это явление спонтанной prompt injection. Предположительно, оно частично возникло из-за обучения модели защите от подобных атак.

Перед релизом разработчики скорректировали обучение. В финальной версии такие сбои происходят реже, а Auto Mode заблокировал все обнаруженные опасные вызовы инструментов.

https://anthropic.com/claude-opus-5-5-system-card
  • ❤ 2
  • 👍 1
  • 🔥 1
  • 🤔 1
More from @data_analysis_ml
  1. Sep 22, 2026⚡️OpenAI выпустила GPT-6 Sol и GPT-6 Luna Семейство GPT-6 расширилось сразу двумя новыми м…
  2. Sep 22, 2026LFM2.5 вошла в лидеры локальных моделей для смартфонов 📱 Artificial Analysis протестирова…
  3. Sep 22, 2026🚨 Alibaba представила один из самых агрессивных планов развития ИИ Главное: • Qwen 4 уже…
  4. Sep 22, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  5. Sep 22, 2026Xiaomi представила MiMo-V2.6 с открытыми весами 👀 В семейство вошли две MoE-модели: - Fla…
  6. Sep 21, 2026⚡️OpenAI заявила о решении более 100 открытых задач по математике 🤯 28 августа OpenAI нач…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →