TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.03K subscribers
Post #708 1.35K
Claude Code Is Steganographically Marking Requests
Thereallo, 2026
Блог

В сфере применения LLM есть большая проблема с доверием. Мы не можем на сто процентов доверять большим языковым моделям, так как они принимают решения вероятностно – отсюда все исследования на тему misalignment, scheming, sandbagging (намеренного занижения результатов оценок моделью), жульничества на бенчмарках и так далее.

При этом мы предполагаем, что как минимум обвязка вокруг модели (например, agentic harness типа OpenCode) является доверенной – получая на вход результаты работы LLM, детерминированно делает то, что написано в коде и что ожидает пользователь. Мы также предполагаем, что когда мы проставляем флаг ENABLE_TELEMETRY в 0, то телеметрия отключается.

Как оказалось, к софту от Anthropic это не применимо. Разработчик, ковыряясь в коде Claude Code, обнаружил, что при выполнении определенных условий, в частности нахождения в китайском часовом поясе или наличия в API_BASE определенных ключевых слов (названий китайских лабораторий), обвязка незаметно меняет системный промпт, выбирая в зависимости условий разные апострофы из ассортимента юникода и заменяя в датах дефисы на слэши, т.е. применяет стеганографию для скрытой передачи сигнала. Причем код, который выполняет эти проверки, обфусцирован, что усложняет анализ.

Это не первая подобная история: когда Anthropic выкатили Fable, то их гардрейлы тихо перенаправляли запросы на более слабую модель, если обнаруживали там подозрительное содержимое. Текущий механизм явно направлен на оценку использования Claude китайцами, о которых Дарио Амодеи не единожды высказывался как о стратегических противниках США по ИИ и которых Anthropic постоянно обвиняют [1][2] в дистилляции. К сожалению, на доверие это влияет очень негативно: что мешает Anthropic подставить промпт, который заставит Claude генерировать менее безопасный код, совершать ошибки или еще как-то деградировать качество генерации, если вы подойдете еще под какой-то критерий? Anthropic дали козырь в руки как сторонникам открытого ПО, так и поборникам ИИ-автаркии.
  • 👍 1
  • 🌚 1
More from @llmsecurity
  1. Sep 14, 2026Post #719
  2. Sep 6, 2026Post #718
  3. Sep 4, 2026Discovery of a new OpenAI agent message board Sydney Von Arx et al., 2026 Сайт Исследовате…
  4. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
  5. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 1: LLMJacking и…
  6. Aug 7, 2026Shieldstral Calvi et al., Mistral AI, 2026 Блог, статья, веса Французы из Mistral затюнили…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →