TGViewer
Data Secrets Data Secrets @data_secrets · 94.8K subscribers
Post #4097 9.92K
Что тут у нас? Это же новая громкая статья от Anthropic про интерпретируемость модели!

Исследование просто взорвало комьюнити: в нем выясняется, что, затюнив какие-то вполне конкретные фичи, мы можем заставить LLM всегда писать уязвимый код, генерировать фишинг и др. Как это работает – выясняем в карточках.

Подробнее: сочный блогпост с визуализациями, статья.
  • ❤ 56
  • 🔥 21
  • 👍 10
More from @data_secrets
  1. Oct 9, 2026В ночь с 7 на 8 октября в результате атаки БПЛА был серьезно поврежден дата-центр Яндекса…
  2. Oct 9, 2026Anthropic обновила Usage Policy, и теперь Claude нельзя обижать 🤡 В документе они пишут,…
  3. Oct 8, 2026OpenAI раскатили на всех пользователей GPT-6 и новую фичу под названием Intelligent UI Теп…
  4. Oct 7, 2026Новый Haiku 5.5, сводка: — В среднем запуск обходится на 75% дешевле Haiku 4.5. — Большой…
  5. Oct 7, 2026Вышел Haiku 5.5
  6. Oct 7, 2026Когда только собрался делать стартап, который продашь за 500M$+, но лимиты закончились чер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →