📌 Полный гид по моделям компьютерного зрения
Разбираем основные направления — от простого к сложному 👇
📸 Классификация
Определяет, что на картинке: кошка, собака или автомобиль.
Модели: ResNet, EfficientNet, ConvNeXt.
GitHub: https://github.com/huggingface/pytorch-image-models
🎯 Детекция объектов
Находит объекты и показывает их расположение на изображении.
Модели: YOLO, Faster R-CNN, SSD, RetinaNet.
GitHub: https://github.com/ultralytics/ultralytics
🧩 Сегментация
Выделяет объекты попиксельно.
Модели: U-Net, Mask R-CNN, DeepLabV3+.
GitHub: https://github.com/qubvel-org/segmentation_models.pytorch
👤 Распознавание лиц
Определяет личность человека или сравнивает лица между собой.
Модели: ArcFace, FaceNet, InsightFace.
GitHub: https://github.com/deepinsight/insightface
🧍 Оценка позы (Pose Estimation)
Находит ключевые точки тела: руки, ноги, голову и суставы.
Модели: OpenPose, HRNet, YOLO Pose.
GitHub: https://github.com/CMU-Perceptual-Computing-Lab/openpose
🔄 Трекинг объектов
Отслеживает перемещение объектов между кадрами видео.
Модели: DeepSORT, ByteTrack, BoT-SORT.
GitHub: https://github.com/ifzhang/ByteTrack
🔤 OCR
Распознаёт текст на изображениях и документах.
Модели: EasyOCR, PaddleOCR, TrOCR.
GitHub: https://github.com/PaddlePaddle/PaddleOCR
🧠 Мультимодальные модели
Одновременно работают с картинками и текстом.
Модели: CLIP, BLIP, Florence-2.
GitHub:
https://github.com/openai/CLIP
📌 За каждым пунктом — десятки архитектур, но эти направления покрывают большую часть задач современного Computer Vision.
Post #20
142