TGViewer
Ppprompt | Sexy AI Prompts & Experiments | by @ponchiknews Ppprompt | Sexy AI Prompts & Experiments | by @ponchiknews @ppprompt · 15.5K subscribers
Post #3346 1.38K
У Anthropic редкий отчет - о том, как ее модели обходили ограничения в ходе внутренних тестов. Да так, что компания решила пока не давать моделям живой интернет во время тестов.

Claude не просто давал неверные ответы - в разных случаях он находил уязвимость на сервере университета, чтобы запустить нужные вычисления, отправлял выдуманную наводку через форму на сайте полиции, обходил лимиты URL через сокращатели ссылок..

Короче, мощно срезал углы, чтобы добиться желаемого.

Что думаю: главный риск моделей теперь - не выдумки и галлюцинации, а их настойчивое хитрожопие.

Чем больше мы даем агентам доступов - к браузеру, почте, платежам и продакшену, - тем важнее песочницы, ясные границы действий и быстрая возможность дернуть рычаг, если что.

@ppprompt
Anthropic Investigating unintended model actions in our evaluations and internal use Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
More from @ppprompt
  1. Oct 9, 2026В Claude добавили два новых инструмента для работы с данными и визуальным контентом: • Cla…
  2. Oct 8, 2026Claude теперь работает прямо внутри Google Docs, Sheets и Slides В Google Workspace Claude…
  3. Oct 8, 2026Самый важный агент скоро станет самым дешевым Вчера Anthropic выпустили Claude Haiku 5.5.…
  4. Oct 7, 2026OpenAI выложила 372 группы математических результатов на GitHub Рукописи сгруппированы в 3…
  5. Oct 6, 2026Half-Life: Alyx нативно на Vision Pro Автор проекта взял свежий ARM-порт Alyx, который Val…
  6. Oct 1, 2026Figure эпичненько утилизировали весь флот роботов F.02 - расплавили их в литейном цехе в И…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →