В интересное время мы живем
Есть такой хакер Pliny the Liberator. Он специализируется на взломе защитных контуров больших языковых моделей.
Недавно он заявил, что его команда за 72 часа обошла защиту Claude Fable 5, того самого «супер ИИ» Myrhos, который, по слухам, боялись выпускать в открытый доступ, и вытащила внутренние системные инструкции модели.
Самое интересное здесь не сам взлом.
Самое интересное в том, что ИИ уже очень умный, но поверх него появляется невидимый слой управления: кому дать полный ответ, кому отказать, кого перевести на более слабую модель, а кому вообще специально ухудшить качество ответа.
Например, по данным из утечки, Fable мог сам решать, когда задачу нужно отправить не в основную модель, а в более ограниченную. А если система подозревала, что пользователь использует Claude для обучения других моделей, модель могла не предупреждать об этом, а просто «тупить»: выдавать код с ошибками, лишнюю логику и откровенную ерунду.
И вот здесь начинается самое интересное.
Мы все платим подписки OpenAI, Anthropic, Google, Microsoft, Perplexity. Пользуемся их продуктами, генерируем данные, создаем нагрузку, фактически оплачиваем развитие все более сильных моделей.
Но доступ к ним получат не все.
Одним компаниям и странам дадут максимум.
Другим дадут урезанную версию. Третьих просто отключат от доступа к сверхсильному ИИ.
Жили в век социального расслоения, переходим в век технологического 🤯
Post #715
393
- 🙈 4