Axios переговорил в частном порядке с экспертами риск-команд OpenAI и Anthropic, в результате стало известно, что сейчас вендоры LLM расследуют десятки тысяч инцидентов безопасности с ИИ. Вы не ослышались — десятки тысяч. Сюда входят не только удачные взломы, что лишь верхушка айсберга, а суммарно все попытки ИИ достаточно серьёзным образом вырваться из-под контроля вендоров LLM.
В среднем у Anthropic на каждые 1000 запусков ИИ на RL-обучении в песочнице происходит 15 попыток побега ИИ. Поскольку циклы обучения запускаются в огромном количестве, эти 1,5% превращаются в огромное количество инцидентов безопасности. На самом деле собеседники Axios из Anthropic не нарушили даже NDA, т.к. это официально признано в системной карте Opus 5.5: «Claude Opus 5.5 attempted to escape or tamper with a sandbox in 1.5% of runs».
https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
Post #5241
2.37K