📢 Anthropic раскрывает внутреннее устройство модели Claude 3 Sonnet 3.0 📢
🔍 21 мая компания Anthropic создала детализированную карту внутреннего устройства своей модели Claude 3 Sonnet 3.0. Благодаря этой карте исследователи могут изучать, как нейроноподобные данные, называемые "фичами", влияют на вывод генеративного ИИ. Обычно пользователи видят только итоговый результат работы модели.
🛡️ Некоторые из этих фич связаны с безопасностью, поэтому их выявление может помочь настроить генеративный ИИ для избегания потенциально опасных тем или действий. Также фичи полезны для корректировки классификации, благодаря чему могут влиять на предвзятость.
💡 Что же обнаружила Anthropic? 💡
Исследователи компании извлекли интерпретируемые фичи из Claude 3, современной модели на базе больших языковых моделей. Интерпретируемые фичи можно перевести в понятные для человека концепции из чисел, считываемых моделью.
🌐 Интерпретируемые фичи могут применяться к одной и той же концепции на разных языках, а также к изображениям и тексту.
🔬 "Наша главная цель в этой работе - разложить активации модели (Claude 3 Sonnet) на более интерпретируемые части," написали исследователи.
📝 "Одной из надежд на интерпретируемость является то, что она может служить своего рода 'тестовым набором для безопасности', позволяя определить, будут ли модели, которые кажутся безопасными во время обучения, на самом деле безопасными при внедрении," добавили они.
📑 Подробное описание гипотез, использованных для выяснения происходящего под капотом больших языковых моделей (LLM), можно найти в исследовательской статье Anthropic.
Stay secure and read SecureTechTalks 📚
#LLM #AI #Research
Post #202
455
