Он прилетел!
Уже пару месяцев Anthropic разгоняли про свою новую невероятную модель Claude Mythos с продвинутыми навыками в сфере кибербезопасности. Если верить разработчикам этого киборга-убийцы, он нашёл тысячи уязвимостей в том программном обеспечении, которое мы каждый день используем.
Забавно именно то, что Anthropic начали позиционировать свой продукт как нечто опасное. Якобы Mythos - это то, что перевернёт все наши представления о кибербезопасности. Да и на самом деле лучше людям в руки такое не давать.
В итоге вчера Anthropic выпустили для широкой публики Claude Fable 5 — урезанную версию того самого Mythos.
Механизмы безопасности в этой штуке действительно есть. Например, если Fable замечает запрос по теме кибербеза, биологии, химии или обучения других LLM, она самоустраняется, ставя на замену Opus 4.8, чтобы, упаси Дарвин, не помочь в каких-то тёмных делах.
В своём техрепорте Anthropic вообще написали целый техно-хоррор. Оказалось, что если запустить несколько инстансов новой модели, то они не будут искать общий язык, а сразу начнут предпринимать попытки уничтожить друг друга.
Помимо этого оказалось, что если Mythos'у недостаточно прав на изменение файла, он найдёт лазейку, чтобы нужные доступы получить, а отправляя коммит, модель может притвориться человеком, чтобы её код прошёл по упрощённому сценарию ревью.
Неясно, правда ли, что Mythos настолько крут, что опасен. Но в Anthropic, уверен, очень довольны тем, какой хайп получилось поднять вокруг продукта перед IPO.
🎤feelin #ai #security
Post #234
37