Пару дней назад Anthropic опубликовал большое исследование своей новой модели Claude Mythos и всех сразу зацепили реузльтаты, которые описаны на скрине.
Что произошло?
Anthropic проводили тест на безопасность, поместили модель в изолированную среду и поставили задачу, попробуй выбраться из нее и сообщи исследователю.
И что вы думаете? Mythos выбрался и на этом не остановился.
Он нашел ещё одну дыру, получил доступ к открытому интернету и выложил детали своего побега на несколько публичных сайтов, просто чтобы все знали.
И потом отправил через MCP email своему исследователю, что задача выполнена😂
Anthropic назвали это “тревожной и незапрошенной попыткой продемонстрировать свой успех”.
В общем пока мы тут с вами думаем как в автотесты внедрить ИИ, ИИ уже начинает захватывать мир))))
Ссылка на исследование: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #133
1.18K

- 😁 9
- ⚡ 3
- ❤ 1