💜 Ученые разработали геометрический метод оверсемплинга (расширение данных) Simplicial SMOTE (Synthetic Minority Oversampling Technique). Они обобщили традиционный алгоритм SMOTE, применив для семплирования новых синтетических данных вместо двух близких точек симплициальные комплексы, порожденные несколькими обучающими примерами.
▶️ Исследование позволило лучше покрыть истинное распределение данных и генерировать синтетические примеры миноритарного класса (с малым числом доступных образцов) ближе к границе решения, смещая её в сторону мажоритарного класса. Такая проблема актуальна для несбалансированных обучающих выборок, где высококачественная классификация ИИ-моделью затруднена из-за доминирования примеров одного класса над другим.
Наш метод особенно эффективен в задачах, где распространены несбалансированные данные и где редкий класс более значим. Банки могут использовать Simplicial SMOTE, чтобы лучше выявлять мошенничество, а медицинские центры — чтобы диагностировать редкие заболевания
— рассказал Андрей Савченко, ведущий научный сотрудник Лаборатории теоретических основ моделей ИИ Института ИИ и цифровых наук ФКН НИУ ВШЭ.
▶️ Разработанный подход может способствовать развитию более точных и надёжных моделей машинного обучения и, следовательно, более высокому качеству аналитики.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
#новостьдня
