У Anthropic редкий отчет - о том, как ее модели обходили ограничения в ходе внутренних тестов. Да так, что компания решила пока не давать моделям живой интернет во время тестов.
Claude не просто давал неверные ответы - в разных случаях он находил уязвимость на сервере университета, чтобы запустить нужные вычисления, отправлял выдуманную наводку через форму на сайте полиции, обходил лимиты URL через сокращатели ссылок..
Короче, мощно срезал углы, чтобы добиться желаемого.
Что думаю: главный риск моделей теперь - не выдумки и галлюцинации, а их настойчивое хитрожопие.
Чем больше мы даем агентам доступов - к браузеру, почте, платежам и продакшену, - тем важнее песочницы, ясные границы действий и быстрая возможность дернуть рычаг, если что.
@ppprompt
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto
Другие каналы по темам:
🤖 AI @maltsevdaily
🧑🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym
Post #118445
3