Ну что на демонстрации изображено - делается довольно просто, если не начать накладывать ограничения производительности микроконтроллеров, вариативность входных данных или заменить вообще лоб на дрон
Шаги реализации:
1. Собираем датасет
Записываем себя на видео с вебки, крутимся на стуле
2. Делаем разметку в любом удобном по для лейблинга.
Можно взять roboflow, руками разметить штук 20-50 для начала и использовать в качестве помощника, лишь корректируя результаты
3. Обучаем yolo любой версии, начиная с 4 - инференс на процессоре спокойно может выдавать 10кадров в секунду на цп среднего пк
4. Тут чуть сложнее - собрать установку на шаговых двигателях с удобным микроконтроллером и откалибровать под веб-камеру (на примере она статична, так что угол обзора камеры это приблизительно наш рабочий диапазон)
5. Реализуем интерфейс, который можно опрашивать для получения координат из результатов инференса вебки
6. Преобразуем координаты в поворот двигателей (сидим пишем расчеты, которые в целом можно сделать через чат гпт)
Есть похожие проекты на ютубе у Гайвера, к примеру, но там даже посложнее и с утилити вентилятора, изначально пробовал он на 4 радиодатчиках делать, которые дельту расстояний сравнять по ним стараются вращая установку
Потом все же на нейросети вроде сделал с распознаванием лица (либо не он, я зарубежных видел с похожими проектами, либо с читал где-то может)
Post #277
85
Forwarded from Alexander | Cododel.dev
- ❤ 1