🕯منظور از «اعوجاج هندسه دادهها» چیست؟
●بسیاری از الگوریتمهای یادگیری ماشین، مانند K-Means، KNN، SVM و حتی شبکههای عصبی، دادهها را بهصورت نقاطی در یک فضای چندبعدی میبینند. فاصلهها، جهتها و پراکندگی این نقاط برای مدل اهمیت دارد.
❌اگر به اشتباه از نرمالسازی به جای استانداردسازی (یا برعکس) استفاده کنید:
●فاصله بین نقاط ممکن است بیش از حد کوچک یا بزرگ شود.
●برخی ویژگیها ممکن است بیش از حد تأثیرگذار شوند.
●مرزهای تصمیمگیری مدل تغییر کنند.
●خوشهبندی یا طبقهبندی نتایج ضعیفتری تولید کند.
به همین دلیل، انتخاب بین نرمالسازی و استانداردسازی صرفاً یک مرحله پیشپردازش ساده نیست؛ بلکه میتواند مستقیماً بر کیفیت یادگیری مدل اثر بگذارد.
#DataGeometry
@toobabigdatascience