Your Transformer is Secretly Linear
Спешу познакомить вас с новой публикацией лаборатории FusionBrain про линейность большинства слоёв языковых моделей декодеров (принята на конференцию ACL 2024 - Main Track, Core A*). Наше исследование позволяет проанализировать внутренние представления языковых моделей, а также без потери качества избавиться от 10-15% слоёв.
Еще мы придумали новый механизм регуляризации, чтобы снизить пресловутую линейность и, тем самым, получить небольшой буст в качестве.
Ниже ссылочки на статью на архиве и код на гитхабе нашей прошлой статьи про анизотропию и внутреннюю размерность эмбеддингов (представляли на EACL 2024).
Статья уже на Hugging Face Daily Papers и уверенно занимает первое место, но мы будем очень рады вашим upvote голосам ⬆️
https://huggingface.co/papers/2405.12250
📕arXiv
👨💻GitHub
📖Хабр
@complete_ai
Post #398
8.38K

- ❤🔥 30
- 🔥 23
- 👍 11
- ❤ 4
- 🎉 2
- 🏆 2