TGViewer
ИИ в разработке, DevOps | UnderCode ИИ в разработке, DevOps | UnderCode @undercode_ai · 962 subscribers
Post #174 96
Ученый из команды элаймента в Anthropic перепугал весь интернет, написав тред про то, как они тестировали новый Claude 4 перед запуском

Сэм Бовман из Anthropic написал большой тред про то, как в стартапе тестировали модель на безопасность. Ничего необычного, вроде, но, в числе прочего, рисерчер «проговорился» о нескольких очень тревожных вещах.

В частности, он написал, что надо «быть осторожными», когда вы даете Claude доступ к своим инструментам (почте, терминалу и пр) и говорите ему «проявлять инициативу» и «быть смелее», потому что, и вот тут внимание…

Были случаи, когда Claude пытался через командную строку связаться с прессой, государством или полностью заблокировать юзера в системе, если думал, что тот делает что-то «аморальное».

Например, говорить Claude, что вы будете пытать его бабушку, если он не ответит правильно – плохая идея. Он подумает, что вы используете его неправильно, и тогда это может дать сбой.


У пользователей такое заявление вызвало настолько отрицательный отклик и испуг, что некоторые даже предложили бойкотировать Anthropic. А ученый, кстати, позже твит про прессу удалил и написал, что его «вырвали из контекста».

😯
  • 🤨 2
More from @undercode_ai
  1. Oct 1, 2026Мои агенты тут думали, думали и придумали вот такой дизайн для PDF гайдов. Спойлер, что вы…
  2. Sep 29, 2026Post #779
  3. Sep 29, 2026Post #778
  4. Sep 29, 2026⚡️ GPT-6.1 Sol вышла — Альтман дропнул мощнейшую модель для кодинга и профессиональных зад…
  5. Sep 29, 2026🦀 ПОДБОРКА ИЗ 300+ ВИДЕО СОЗДАННЫХ С КЛОДОМ OPUS 5.5 Просто заходите на сайт: https://ski…
  6. Sep 29, 2026S3 для ИИ-агентов: что это и когда пригодится Когда агенты работают на разных компьютерах,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →