TGViewer
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение @dsproglib · 18.3K subscribers
Post #7645 1.61K
🧠 Зачем Pipeline в scikit-learn

Частая ошибка — сначала преобразовать весь датасет, а потом разделить его на train/test:


scaler.fit_transform(X) # уже увидел весь датасет
X_train, X_test = train_test_split(X)


💡 Правильнее спрятать preprocessing внутрь Pipeline:


from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression

model = make_pipeline(
StandardScaler(),
LogisticRegression()
)

model.fit(X_train, y_train)
score = model.score(X_test, y_test)


Теперь StandardScaler обучается только на X_train.

Особенно полезно при cross-validation: каждый фолд получает свой fit preprocessing.

🤩 Всё, что вычисляет параметры по данным — scaler, encoder, imputer и т. п. — лучше включать в Pipeline. Так меньше шансов случайно устроить data leakage.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
  • 👍 6
  • 🥰 2
More from @dsproglib
  1. Sep 20, 2026Что выведет код? 👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None 🐸 Библиотека задач по Data Sc…
  2. Sep 19, 2026🌞 3 open-source инструмента для AI-агентов 🔘 Agent-Reach — доступ к Twitter/X, YouTube,…
  3. Sep 18, 2026А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tp…
  4. Sep 18, 2026📍 Навигация: Вакансии • Задачи • Собесы 🐸 Библиотека дата-сайентиста
  5. Sep 17, 2026🤗 Fine-tuning LLM в Google Colab — без собственной GPU Unsloth Studio позволяет попробова…
  6. Sep 15, 2026🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagation Sakana AI представи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →