🧱 Синтетические данные в компьютерном зрении
#synthetic_data
В последние два месяца меня сильно увлекла тема влияния данных на качество моделей. Современный deep learning уходит от "давайте поэкспериментируем с архитектурами, придумаем новую 400-ую активацию" и движется в сторону "увеличим количество качественных данных и сделаем модель побольше", что в итоге приносит стабильный прирост качества (тут интересно почитать заметку исследователя из OpenAI , который пишет, что ваша результирующая модель, по факту, является датасетом, на котором она училась). Но количество качественных данных ограничено, и что делать, когда их мало?
Для себя я нашел следующий ответ - использование синтетических данных, созданных с помощью генеративных моделей, и вот почему:
👉 Генерация мультимодальных датасетов из обычных. По моему опыту, один из действительно успешных кейсов применения синтетических данных. Мы используем мультимодальную модель для создания текстовой разметки. Например, генерация caption для изображений уже стала стабильным приемом в обучении генеративных моделей - работы Pixart, DALLE, Sora отличное этому подтверждение.
👉 Генерация датасетов с нуля. Смотришь на генерацию Stable Diffusion и думаешь, вау, почему бы не сгенерировать нужный датасет. Но на практике данные, использованные для обучения, представляют общий домен, и если мы захотим сгенерировать медицинские данные, то модель генерирует бред. Вдобавок, картинки с диффузией очень просты по структуре сцены, и в них сложно увидеть различные сложные сцены. Кажется, что только минусы, но! Когда у вас мало данных, добавление синтетических данных и дообучение на реальных данных действительно повышают качество. Главное, помните, что если есть возможность добыть реальные данные, то это до сих пор лучший способ улучшить качество модели.
Post #59
640
