Для нейросети фотография сначала совсем не похожа на человека, дерево или чашку. На вход она получает числа, описывающие пиксели, а узнавать знакомые объекты учится постепенно — на огромном количестве примеров. 👁
Фото превращается в числа.
Цифровое изображение состоит из пикселей, а каждый пиксель хранит числовые значения цвета. Перед обработкой эти значения обычно приводят к удобному диапазону и передают модели как массив чисел. Именно с него начинается «зрение» нейросети.
Сеть замечает простые признаки.
В классических сверточных нейросетях первые слои учатся реагировать на простые детали: границы, контрасты, линии, текстуры. Их никто вручную не программирует правилом «ищи край чашки» — полезные признаки возникают во время обучения модели на изображениях.
Слои собирают формы.
Дальше простые признаки комбинируются в более сложные. Отдельные линии и изгибы могут постепенно складываться в характерные части объекта, а затем — в представление всего изображения. Современные архитектуры делают это по-разному: кроме CNN сегодня используются и модели на основе vision transformers.
Обучение связывает их с объектами.
Модели показывают множество изображений с известными правильными ответами — метками. После каждого предсказания система сравнивает результат с правильным ответом и корректирует внутренние параметры так, чтобы в следующий раз ошибаться меньше. Именно так признаки постепенно начинают связываться, например, с классами «чашка» или «дерево».
Модель считает вероятности.
Нейросеть обычно не говорит: «Я совершенно точно вижу чашку». Она выдаёт оценки для возможных классов — например, что изображение с высокой вероятностью относится к одному классу и с меньшей к другим. В учебных примерах Keras результат прямо выражается как вероятность одного класса относительно другого.
Несколько объектов ищут отдельно.
Здесь есть важное различие. Классификация отвечает на вопрос «что изображено на картинке в целом?». Если нужно найти одновременно человека, дерево и чашку и показать, где каждый из них находится, используется уже задача обнаружения объектов — object detection. А если нужно определить точные границы каждого объекта вплоть до пикселя, это называется сегментацией.
Тебе интересно, как ИИ распознаёт лица или текст на фото? 🤖
#нейросети #технологии
Эстетика в списках в MAX 🟪
Эстетика в списках 🌀
Post #1077
59

- ❤ 1
- 👍 1
- 💯 1