Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search
[Статья]
[Код рады бы запоенсорсить, да комплаенс не позволяет]
[Авторазбор на gonzo_ML_podcasts]
Введение
Лучшие умы 🧠 человечества уже без малого десятилетие озадачены поиском более эффективной альтернативы механизму внимания. Было много интересных решений, но как оказывалось, чего-то в них всегда не хватало, чтобы иметь ту же выразительность и универсальность, что attention.
Потому вместо полного отказа от attention люди пробовали гибридные модели с небольшим количеством attention блоков и заменой всего остального на что-то более дешевое (Mamba, LinearAttention, и т.д.).
И сегодняшняя статья про поиск 🔎 такого гибрида.
Post #545
4.77K

- ❤ 4
- 🔥 1