У системного аналитика Анны есть два чистых набора данных:
1. Тренировочный набор (объём
V примеров). Это её "вино" 🍷.2. Тестовый набор (объём
V примеров). Это её "вода" 💧.Анна хочет проверить устойчивость модели к "загрязнению" данных. Она делает два шага:
1. Шаг "Контаминация теста": Она берёт случайную выборку из
v примеров (v < V) из тренировочного набора и добавляет их в тестовый набор. Теперь тестовый набор "загрязнён" тренировочными данными.2. Шаг "Обратное смешивание": Она тщательно перемешивает теперь уже смешанный тестовый набор. Затем берёт случайную выборку из
v примеров из этого смешанного тестового набора и возвращает её обратно в тренировочный набор.Вопрос:
Чего в результате больше в пересчёте на ожидаемое количество примеров:
* Тренировочных примеров в тестовом наборе? (т.е., "примесь вина в воде")
* Тестовых примеров в тренировочном наборе? (т.е., "примесь воды в вине")
* Или они равны?
Пояснение для контекста:
* "Тренировочные примеры" в тестовом наборе — это утечка данных, ведущая к переобучению и неадекватной оценке модели! ⚠️
* "Тестовые примеры" в тренировочном наборе — это шум, который может немного ухудшить обучение, но менее критичен для итоговой оценки.
#logics@cool_analyst
