Claude Mythos..
.. еще не выпущен, но опубликовали исследование про него:
https://red.anthropic.com/2026/mythos-preview/
Я ещё сам не дочитал, но вот несколько мыслей по тому, что успел прочесть.
Антропики говорят, что целенаправленно не обучали модель что-то ломать и это просто вылезло само потому что модель стала умнее по всем направлениям. И вот это, кажется, загоняет их в угол. Нельзя выпилить эти навыки, не сломав всё остальное. Они боятся дать такую модель массам прямо сейчас, но и держать её вечно за забором не выйдет. Я не до конца понимаю, почему они не зацензурируют её как OpenAI, но и не хотел бы, чтобы так произошло. Я думаю что, нормальным путем было бы ввести какой-то kyc или другую верификацию именно пользователей использующих модель для тестирования и поиска уязвимостей. 100% у антропиков есть список таких товарищей.
Еще становится страшновато от уровня автономности. Человек пишет "найди уязвимость", идёт спать, а утром видит готовый рабочий эксплойт с рутом на FreeBSD. Да, это работает в изолированной среде, но когда параллельно читаешь их же исследование про то, что у Claude формируются функциональные аналоги эмоций, то задумываешься насколько эта изоляция для него вообще преграда..
Петр Уваров был очень разочарован нерабочими нейро-репортами, но думаю, если Mythos предадут широкой массе - он превратится в кота на своей аве)
P.S. частично зря быканул. Они пишут "Security professionals whose legitimate work is affected by these safeguards will be able to apply to an upcoming Cyber Verification Program". Посмотрим насколько это будет работать и не заабузят ли эту верификацию товарищи из предыдущего поста.
Post #26
1.34K

- 😱 6
- 😁 5
- ❤ 4
- 👍 1
- 🗿 1