Хорошая новость, которой я забыла чуть раньше поделиться, – помимо хайпа вокруг того, что скоро может случиться релиз GPT-4, HuggingFace со своей стороны обещают выпустить опенсорс версию модели Flamingo от DeepMind
Напомню, что основная суть Flamingo в том, что взяли замороженные веса визуальной модели и языковой модели и «склеили» их вместе с помощью обучаемых параметров (ресемплера и аттеншена, если точнее). Имхо, Flamingo входит в число самых важных релизов прошлого года: там и показали, что замораживать веса можно очень эффективно, и ввернули в обычную LM мультимодальность, так, что она смогла например отвечать на вопросы по картинке
В целом рискну предположить, что сейчас начнется вторая волна хайпа по мультимодальности, так как мультимодальность со способностю даже в видео обещают в отношении GPT-4, а Microsoft уже собрал Visual ChatGPT, которой можно отправлять картинки
Поэтому мне кажется, что HF делают очень важное дело, так как они могут зарелизить крутые туториалы о том, как подобные модели обучать (как все уже похвалили их гайд по RLHF) и сами модели, которые можно будет тюнить. Сейчас уже есть техническая записка c заметками о том, с какими сложностями они столкнулись при обучении. Например, пишут, как справляться со взрывающимися градиентами и активациями и советуют RMSNorm вместо LayerNorm
Post #917
2.41K

- ❤ 13
- 🔥 9
- 👍 3