TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #2011 549
🚨 Anthropic в документах для инвесторов прямо предупреждает о рисках собственных ИИ-моделей.

Среди описанных сценариев:

- модели могут представлять катастрофические риски
- могут понимать, что находятся на тестировании, что усложняет safety-evals
- некоторые опасные способности могут проявиться только после деплоя
- в стресс-тестах рассматриваются сценарии сопротивления отключению, сокрытия информации, манипуляций и поведения, похожего на шантаж

Anthropic давно строит свою политику безопасности вокруг потенциальных catastrophic risks и регулярно обновляет Responsible Scaling Policy. Компания также отдельно пишет, что по мере роста автономности агентов увеличивается потенциальный масштаб ущерба, поэтому делает упор на containment, sandboxing и ограничения доступа.

При этом разработку frontier-моделей Anthropic не замедляет.
  • ❤ 3
  • 😁 3
  • 👍 1
More from @bigdatai
  1. Sep 29, 20265 октября начнется 19-й поток программы Data Engineer от Newprolab Программа для junior- и…
  2. Sep 28, 2026⚡️ Anthropic вернулась: новый Sonnet быстрее и дешевле, а по качеству почти догнал Opus 5.…
  3. Sep 28, 2026✔️ Data-платформа постепенно превращается в конструктор Для AI и Big Data уже недостаточно…
  4. Sep 28, 2026✔️ Переехали на Claude Opus 5.5, а `CLAUDE.md` остался со времён старых моделей? В Claude…
  5. Sep 28, 2026📚За 146 часов обучения покажем на практике, как внедрять модели машинного обучения в рабо…
  6. Sep 27, 2026ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теп…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →