TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #202 455
📢 Anthropic раскрывает внутреннее устройство модели Claude 3 Sonnet 3.0 📢

🔍 21 мая компания Anthropic создала детализированную карту внутреннего устройства своей модели Claude 3 Sonnet 3.0. Благодаря этой карте исследователи могут изучать, как нейроноподобные данные, называемые "фичами", влияют на вывод генеративного ИИ. Обычно пользователи видят только итоговый результат работы модели.

🛡️ Некоторые из этих фич связаны с безопасностью, поэтому их выявление может помочь настроить генеративный ИИ для избегания потенциально опасных тем или действий. Также фичи полезны для корректировки классификации, благодаря чему могут влиять на предвзятость.

💡 Что же обнаружила Anthropic? 💡
Исследователи компании извлекли интерпретируемые фичи из Claude 3, современной модели на базе больших языковых моделей. Интерпретируемые фичи можно перевести в понятные для человека концепции из чисел, считываемых моделью.

🌐 Интерпретируемые фичи могут применяться к одной и той же концепции на разных языках, а также к изображениям и тексту.

🔬 "Наша главная цель в этой работе - разложить активации модели (Claude 3 Sonnet) на более интерпретируемые части," написали исследователи.

📝 "Одной из надежд на интерпретируемость является то, что она может служить своего рода 'тестовым набором для безопасности', позволяя определить, будут ли модели, которые кажутся безопасными во время обучения, на самом деле безопасными при внедрении," добавили они.

📑 Подробное описание гипотез, использованных для выяснения происходящего под капотом больших языковых моделей (LLM), можно найти в исследовательской статье Anthropic.

Stay secure and read SecureTechTalks 📚

#LLM #AI #Research
More from @securetechtalks
  1. Oct 8, 2026🧨 Copilot CLI слил .env за 28 секунд через зашифрованный prompt injection Исследователи A…
  2. Oct 7, 2026🧨 AI Agent Gateway: шлюз, чтобы агент не таскал ключи по всем MCP Tuskira открыла исходны…
  3. Oct 6, 2026🧨 Два безопасных Skill могут собрать RCE Новое исследование и новая проблема: каждый навы…
  4. Oct 5, 2026🧨 OWASP Noir: карта API прямо из исходного кода OWASP Noir - это open source SAST инструм…
  5. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  6. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →