TGViewer
Запрети мне псевдолейблить Запрети мне псевдолейблить @pseudolabeling · 4.28K subscribers
Post #68 2.44K
Запрети мне псевдолейблить Из интересного, что удалось вынести для ICR, это разобраться какие бывают оверсемплинги для табличек. По ссылке оригинальный пост Ивана Исаева, с которым решали ICR, который я переписываю немножко сюда + дополняю своими мыслями. Оверсемплинг стоит попрбовать…
#ICR #таблицы #аугментация
Попробуем короткий формат?

Первый из небанальных кандидатов для апсемплинга- Gaussian Noise Up-sampling. Идея простая:
0. Выбираем параметры нормального распределения для каждой фичи
1. Из класса, которого меньше, выбираем объект
2. Добавляем к его признакам случайный нормальный шум
3. Добавляем получившийся синтетический объект в датасет для обучения (оригинальные объекты класса мы туда изначально не добавляем)

Теоретически работать должно лучше обычного апсемплинга, потому что объекты разные, их больше и они 'аугментированные'. В statistical learning где-то даже есть теоретический результат: если параметры шума аугментации меньше или сравнимы с реальным шумом измерения признака, то модель будет асимптотически лучше оценивать истинные параметры. Тут важно помнить, что семлируем мы с повторениями- это уменьшает итоговую дисперсию оценки параметров. Для линейных моделей даже доказательство есть.

Казалось бы, а зачем ты, Дима, про линейные модели рассказываешь? Мы же бодрые-молодые датасентисты из 2018, мы Catboost учим и стакаем с LightGBM. Дело в том, что теоретические трюки, улучшающие линейные модели обычно помогают и более сложным моделям работать лучше. Обычно.

Из плюсов:
1. Может быть лучше, чем обычные веса для классов, если правильно готовить параметры распределения шума для признаков
2. Работает для регрессии
3. Апсемплинг с повторениями позволяет уменьшить влияние выбросов

Проблемы у такого подхода тоже очевидные:
1. Параметры истинного распределения ошибки измерения признаков нам никто не даст ->
2. Параметры надо подбирать
3. То, что текущие параметры дают модель, которая работает на валидации лучше, совсем не значит, что мы их лучше подобрали, эти параметры тоже легко оверфитнуть
4. Не все ошибки измерения признаков распределены нормально (вспомним категориалки)
5. С пропущенными значениями тоже совершенно не ясно, что делать
6. Мы искусственно раздуваем данные, что замедляет пайплайн
  • 🔥 7
  • 💩 2
  • 🐳 2
  • 👍 1
More from @pseudolabeling
  1. Sep 29, 2026Количество золотых медалей на Kaggle соревновании выглядит примерно так. Можно сказать, чт…
  2. Sep 29, 2026Когда моя тима шагает по лб на странной эмпирике- это мы нашли стопроцентную хорошую эмпир…
  3. Sep 28, 2026Запрети мне псевдолейблить pinned a photo
  4. Sep 28, 2026Моего тиммейта по Rogii забанили на каггле Он участвовал в проекте CayleyPy и развивал мат…
  5. Sep 26, 2026Ферма перевалила за 10к участников! Это значит две новости для вашего рейтинга: 1. 30+ зол…
  6. Sep 23, 2026Тем временем, алаймент вышел из под контроля
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →