👍🏻4 отличные NN-модели трансферного обучения для компьютерного зрения👀
Трансферное обучение (Transfer Learning), когда ML-модель предварительно обучена на других задачах, хорошо работает в условиях недостатка вычислительных ресурсов для тренировки и/или количества данных. В области Computer Vision неплохих результатов позволяют добиться следующие нейросетевые модели трансферного обучения:
• VGG-19 – сверточная нейронная сеть из 19 главных слоев (16 сверточных, 3 полносвязных), 5 слоев MaxPool и 1 слой SoftMax. Она была разработана и обучена в Оксфордском университете в 2014 году. Для обучения VGG-19 использовалось более 1 миллиона цветных изображениях 224×224px из базы данных ImageNet.
• Inceptionv3 – сверточная нейронная сеть глубиной 50 основных слоев, созданная и обученная в Google также на примерах базы ImageNet, но размер входного изображения чуть больше, чем у VGG-19 – 299×299px. На соревнованиях ImageNet 2014 года, где решались задачи детектирования, классификации и локализации объектов на изображении, именно Inceptionv3 заняла 1-е место, а ее основной конкурент, VGG19 – второе.
• ResNet50 - сверточная нейросеть из 50 основных слоев, разработанная в 2015 году Microsoft для распознавания изображений. Эта ML-модель также обучена на миллионе цветных изображений 224×224px из базы ImageNet и может классифицировать до 1000 объектов. Сеть была создана, чтобы избавиться от затухающих и взрывных градиентов. При том, что ResNet50 имеет меньше параметров, чем VGG-19, она показывает более точные результаты.
• EfficientNet – сверточная нейросеть 2019 года от Google, которая сегодня считается одной из самых эффективных и точных ML-моделей. Точность сверточных нейросетей растет с увеличением ширины (количества фильтров в каждом слое), глубины (количества слоев в модели) и разрешения (размер входного изображения). Но возрастание этих параметров приводит к существенному росту вычислительных затрат. Поэтому было создано 8 реализаций архитектуры EfficientNet, даже самая простая из которых (B0) показывает отличные результаты распознавания изображений при 5,3 миллионах параметров.
Post #196
1.04K