TGViewer
Channel Public Channel
Data Mirosh

Data Mirosh

@araprof

Всім привіт. Мене звати Ігор і я викладач.
Працюю в KSE та КНУ

Підтримати: https://send.monobank.ua/jar/3rgj2uzZTs

Зв'язок: @aranaur
Youtube: https://www.youtube.com/@datamirosh

Cайт: http://aranaur.rbind.io
Subscribers
2.6K
Photos
66
Videos
1
Links
56

Showing posts older than #84 · Back to latest

Older Posts 15 shown
Post #83 3.66K
Темний бік статистики: як євгеніка створила улюблені нами підходи 🌑📊

На своїх курсах я часто розповідаю про різноманітні статистичні підходи, названі на честь своїх винахідників. Зазвичай у топі моїх згадок — історія про те, як Вільям Госсет змушений був публікувати роботи під псевдонімом Student через суворі корпоративні правила пивоварні Guinness 🍺👨‍🔬. Але сьогодні хочу поділитися темною стороною статистики.

Коли ми розбираємо ANOVA чи будуємо регресії, мало хто замислюється, з чого насправді все почалося. А почалося з того, що видатні вчені свого часу захопилися соціальною філософією, яку сьогодні ми б назвали щонайменше неетичною ⚠️.

Ось кілька цікавих фактів про тих, чиї імена ми так часто бачимо в підручниках:

➡️ Френсіс Гальтон 🧬. Саме він подарував нам такі базові концепти, як "кореляція" та "регресія до середнього". Але він же і вигадав термін «євгеніка», надихнувшись працями свого двоюрідного брата Чарльза Дарвіна. Гальтон настільки цим горів, що навіть став почесним президентом Британського євгенічного товариства.

➡️ Карл Пірсон 📉. Так-так, той самий критерій Пірсона. Він був протеже Гальтона і очолив кафедру євгеніки в Лондонському університеті. Пірсон цілком серйозно вважав, що суспільство має поповнюватися лише за рахунок «кращих генофондів» і відкрито виправдовував війни з «нижчими расами» 💀.

➡️ Рональд Фішер 📐. Людина, яка дала нам "дизайн експерименту", "дискримінантний аналіз" та славнозвісний F-розподіл. У вільний від виведення формул час Фішер був активним діячем комітетів із просування євгеніки та дуже переймався тим, що вищим класам потрібно терміново підвищувати народжуваність 📈.

На щастя, математика виявилася значно об'єктивнішою за світогляд своїх творців 🙏. З часом статистика стала фундаментом для Data Science та Machine Learning 🤖, а євгеніка повністю себе дискредитувала після того, як її ідеї спробували реалізувати на практиці в нацистській Німеччині.

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • 👍 27
  • ❤ 16
  • ✍ 5
  • 👎 2
  • 😭 1
Post #82 3.15K
Causal Inference для сміливих: як не плутати кореляцію з каузальністю

📉 У Data Science ми часто грішимо тим, що згодовуємо алгоритмам купу змінних і щиро радіємо високим метрикам. Але коли бізнес приходить із питанням на кшталт: "Що буде з продажами, якщо ми піднімемо ціну на 10%?", класичні предиктивні моделі можуть відверто збрехати.

Тут на сцену виходить Causal Inference. Якщо ви хочете зануритись у цю тему і ваш робочий інструмент — Python🐍, настійно рекомендую книгу "Causal Inference for The Brave and True".

Що корисного розбирається всередині:

1️⃣ База: від логіки рандомізованих експериментів до глибокого розуміння bias.
2️⃣ Класика економетрики: Propensity Score, Instrumental Variables (IV), Difference-in-Differences (DiD).
3️⃣ Просунуті методи: Regression Discontinuity Design (RDD) та Synthetic Control.

А ще тут детально розбираються рівняння стандартної похибки середнього та пастки малих вибірок, про які я писав раніше.

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • 🔥 27
  • ❤ 9
  • 🤔 2
Post #80 6.55K
Оновлений доступ до DataCamp: перезавантаження 🐧

Вчора було 30 березня, а це означає, що термін дії нашої попередньої групи добіг кінця. Для тих, хто не встиг добити свій трек по Python, або раптом відчув непереборну жагу до вивчення SQL чи машинного навчання — я підготував нову групу.

Алгоритм доступу залишається незмінним і без зайвих бюрократичних рухів:

1️⃣ Переконайтеся, що ви підписані на мій канал. Хоча я навіть не знаю, як би ви інакше читали цей текст, але перевірити варто.
2️⃣ Переконайтеся, що ваш акаунт на DataCamp зареєстрований на один із цих доменів: gmail.com, kse.org.ua, knu.ua, kneu.ua або kneu.edu.ua.
3️⃣ Переходьте та приєднуйтесь до нашого нового класу за цим посиланням.

Забирайте лінк та повертайтеся до коду. Інструменти самі себе не опанують, а дані самі себе не проаналізують (принаймні, поки що).

Клас діє до 16 вересня 2026 року.

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • ❤ 103
  • 🔥 15
  • ❤‍🔥 4
  • ✍ 1
  • 👍 1
Post #79 3.7K
Найстрашніше рівняння та мільярдні помилки: 5 класичних прикладів 📊

tl;dr: У своїй статті Говард Вейнер називає рівняння стандартної похибки середнього (рівняння де Муавра) "найнебезпечнішим рівнянням". У статті наведено п'ять класичних прикладів, які чудово це ілюструють.

Суть проблеми полягає в тому, що малі вибірки завжди генерують більший розкид (дисперсію) результатів. Якщо ми дивимося лише на екстремальні значення і забуваємо про розмір вибірки, ми ризикуємо знайти закономірності там, де працює звичайна математика. Ось п'ять прикладів із дослідження Вейнера:

➡️ Trial of the Pyx. З 1150 року в Англії перевіряли якість карбування монет. Допустима похибка для партії монет розраховувалася пропорційно до кількості монет, а не до квадратного кореня з їх кількості. Ця математична хиба дозволяла обманювати систему та переплавляти заважкі монети для власної вигоди протягом майже 600 років!

🔗 Про інші приклади написав тут.

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • 🔥 28
  • 👍 7
  • ❤ 2
Post #78 3.14K
Мистецтво катування даних: тренажер з p-hacking 📊

У світі Data Science та наукових досліджень існує така темна магія, як p-hacking (або data dredging). Суть цієї проблеми дуже проста: якщо достатньо довго "мучити" дані, вони обов'язково зізнаються у чому завгодно.

Felix Schönbrodt створив p-hacker - додаток на базі R Shiny, де ви можете спробувати себе в ролі недобросовісного аналітика.

❗️p-value не є Священним Граалем. На реальній практиці - чи то в бізнес-аналітиці, чи в академічних статтях - дуже легко натрапити на результати, які виглядають ідеально, але по факту є лише наслідком багаторазового тестування та маніпуляцій з вибіркою. Це одна з головних причин так званої "кризи відтворюваності" в сучасній науці.

Також рекомендую відео від Josh Starmer: p-hacking: What it is and how to avoid it!

👇У коментарях накидаю код з прикладом.

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • ❤‍🔥 29
  • 👍 14
  • ❤ 6
Post #74 3.57K
Матеріали з ЛекторШефу: як ми відмовлялися від ручної верстки на користь Quarto 📊

Минулого тижня в стінах КШЕ пройшов наш семінар. Дуже дякую всім, хто знайшов час приєднатися офлайн чи в зумі - радий був бачити такий живий інтерес до оптимізації нашої щоденної рутини.

Трохи рефлексії: Після нашої дискусії я ще раз переконався, що проблема відтворюваності (reproducibility) та постійного ручного оновлення даних у презентаціях болить багатьом. Незалежно від того, працюєте ви з Python чи з R, перехід на такі інструменти - це інвестиція у власний спокій. Ви один раз прописуєте логіку, а далі звіти верстають себе самі, залишаючи вам час на справжню аналітику, а не на вирівнювання абзаців.

Для тих, хто не зміг долучитися або хоче переглянути технічні моменти ще раз:

- 🖥 Презентація
- 🎥 Повний відеозапис лекції

Не обмежуйте себе одним інструментом.
Будьте гнучкими і не зупиняйтесь вчитися!

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • ❤ 51
  • 🔥 10
  • 😍 3
Post #73 3.12K
📊 Дані щодня зростають у геометричній прогресії — в таблицях, базах і звітах. Якщо робота з ними стала рутиною — час впроваджувати AI.

Навчіться будувати повний AI-аналітичний процес: EDA (розвідковий аналіз даних), очищення та валідація даних, SQL-аналіз, візуалізація, ML та інтерпретація результатів — на курсі «AI для аналізу даних» від robot_dreams.

Після 10 занять ви навчитеся:
⚙️ використовувати AI для очищення, валідації та первинного аналізу даних
⚙️ застосовувати ML для прогнозування метрик і виявлення аномалій
⚙️ створювати ефективні промпти для EDA, SQL, візуалізацій та перевірки якості результатів AI
⚙️ генерувати, оптимізувати й пояснювати SQL-запити для ефективної роботи з базами даних

Лекторка: Кристина Ісакова — PhD в області математичного моделювання з 7 роками досвіду в Data Science. Розробляла моделі передбачень та моніторингу метрик у німецькій транспортній компанії FlixBus і будувала рекомендатори для страхових компаній в CHECK24.

Деталі, програма та реєстрація ⬅️
  • 👍 13
  • ❤ 7
  • 🔥 2
  • 🤔 2
  • 😁 1
Post #72 3.2K
Рубрика: Shameless self promotion

В КШЕ анонсували подію зі мною, тож не можу не поділитися.

Тема звучить дещо провокативно, але, погодьтеся, життєво: «Досить гратися зі шрифтами! Quarto: презентації, сайти та звіти, які верстають себе самі».

Якщо ви (як і я колись) втомилися нескінченно копіювати графіки з Excel у PowerPoint, «з’їжджаючі» верстки та ручне оновлення звітів при зміні однієї цифри в даних — вам сюди.

На лекції розкажу про Quarto. Це інструмент, який дозволяє об’єднати текст, код (Python/R) та візуалізації в єдиний процес.

Це must-have для викладачів, аналітиків, студентів і всіх, хто хоче мати надійні робочі процеси замість хаосу у файлах.

🗓 Коли: 10 лютого, 18:00–20:00
📍 Де: KSE Dragon Capital Building (ауд. 1.08.1) + Онлайн
🔗 Реєстрація обов'язкова: Заповнити форму

До зустрічі! 👋

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • ❤ 42
  • 🔥 9
Post #69 4.78K
Обіцяв, що буду більше писати постів в телеграм, тож тримайте.

Пост-звіт про завершення мого курсу "STAT150 R for Data Science" в KSE. 👨‍💻

Давно мріяв про власну айдентику для курсів, і ось нарешті реалізував ідею - гексагональні наліпки. 💡 Тепер кожен студент, що успішно закінчив курс, отримує свою. Їх можна збирати на ноутбуці, створюючи такий собі освітній roadmap!

Маскотом курсу став пінгвінчик 🐧, адже ми часто працювали з даними з пакету {palmerpenguins}. Згенерував його в Gemini, а решту дизайну доробив кодом.

Вже після закінчення курсу (і виставлення всіх балів 😉) студенти зробили мені неймовірний подарунок на день народження! 🎁 Худі з нашим пінгвінчиком попереду та Смеаґолом, що тримає логотип {tidyverse} (my tidy precious 😁).

Це була чудова подорож!

P.S. Студентам "MATH840 Time Series" приготуватись.

🫶 Банка | 📺 Youtube | 🔗 Сайт
  • 🔥 84
  • ❤ 37
  • 🎉 2
  • 🤡 1
Post #68 9.42K
🐧 Безкоштовний доступ до DataCamp знову активний! 🐧

Друзі, привіт! Як і обіцяв, оновлюю класрум для доступу до всіх курсів на DataCamp - топовій платформі для вивчення R, Python, SQL, машинного навчання та аналітики даних.

🎓 Як отримати доступ:

1️⃣ Підпишіться на мій канал.
2️⃣ Переконайтеся, що маєте акаунт на DataCamp з поштою на одному з цих доменів:
gmail.com
kse.org.ua
knu.ua
kneu.ua
kneu.edu.ua

3️⃣ Приєднуйтесь до групи за цим посиланням.

⏳ Важливо: Цей доступ буде дійсний аж до 30 березня 2026 року! У вас купа часу, щоб прокачати свої навички.

✅ Якщо було корисно - вподобайте, поширте та підтримайте!

🫶 Банка |📺 Youtube | 🔗 Сайт
  • ❤ 176
  • 👍 12
  • 🤩 7
  • 🔥 1
Post #67 9.48K
🔥 Безкоштовний доступ до DataCamp знову активний! 🔥

Щось геть не було часу писати пости, але я про Вас не забув, тож знову відкриваю доступ до всіх курсів на DataCamp — це топова платформа для навчання R, Python, SQL, машинного навчання та аналітики даних. 🎓

Як отримати доступ:
1️⃣ Підпишись на мій канал
2️⃣ Майте акаунт на DataCamp з поштою на одному з таких доменів:
- gmail.com
- kse.org.ua
- knu.ua
- kneu.ua
- kpi.ua

3️⃣ Заходь у групу.

⏳ Доступ працює до 7 жовтня 2025. Потім оновлю лінк, тож залишайтесь на зв'язку.

✅ Якщо було корисно — вподобай, пошир, підтримай!

🫶Банка | 📺 Youtube | 🔗 Сайт
  • ❤ 156
  • 👍 16
  • 🔥 3
Post #66
Channel photo updated
Post #63 10.9K
🔥 Безоплатний доступ до всіх курсів на DataCamp! 🔥

Маєте бажання опанувати нові навички у сфері даних? Я надаю безкоштовний доступ до всієї бібліотеки курсів на DataCamp! 🎓

Як підключитися:

1️⃣ Підпишіться на мій канал. 📲
2️⃣ Створіть (або вже майте) обліковий запис на DataCamp з електронною поштою, яка закінчується на один з таких доменів: ✉️
- gmail.com
- knu.ua
- kneu.ua
- kneu.edu.ua
- kpi.ua
- kse.org.ua

3️⃣ Перейдіть за посиланням та доєднайтесь до групи 🔗

⏳ Група відкрита до 11 квітня 2025 року! Після цієї дати я відкрию нову групу, щоб ви могли продовжити навчання.

Не втрачайте можливість розширити свої знання та навички разом з DataCamp! 🚀

З Вас вподобайка та поширення інформації👍

🫶Підтримати | 📺 Youtube | 🔗 Сайт
  • 🔥 117
  • ❤ 32
  • 👍 17
  • 👎 1
  • 🤝 1
Post #62 4.56K
📖Dive into Deep Learning

📚Це один з найкращих підручників з глибокого навчання, який я коли-небудь читав. І ось чому:

- Він відкритий та безкоштовний 📖
- Чудова послідовність викладу матеріалу 📝
- Код одразу на PyTorch, NumPy/MXNet, JAX та TensorFlow 🧑‍💻

⭐️ 23.4k зірочок на GitHub.

Додатково можна переглянути курс Practical Machine Learning від Стенфордського університету від 2021 року.

🫶Підтримати | 📺 Youtube | 🔗 Сайт
  • 👍 32
  • ❤ 11
  • 🔥 3
  • 😍 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →