TGViewer
Дата канальи Дата канальи @datarascals · 6.26K subscribers
Post #187 2.47K
#кейсы #ML

Митап прошел, пора возвращаться к историям, ради которых канал и создан.

Этот кейс вспомнил, когда говорил со своим хирургом о страховании осложнений от операций.
Когда дают подписать информированное согласие — пишут возможные осложнения и их частоту встречаемости со ссылкой на источник, так вот если ввести поправку на множественные сравнения
Он сначала чуть смеялся, даже не слышал о таком.
Тема действительно редкая, сходу гуглится программа у испанцев — осложнения обязательно страхуются.
Еще публикации 10-15 летней давности в пластической хирургии — что логично, ведь пластику, как правило, делают за свои, то есть вписаться в бюджет крайне желательно — и вот здесь-то страховка от осложнений не помешает.

Во времена ковида 🤢лично для себя прививаться или нет я принимал по соотношению стоимости страховки и выплаты при наступлении осложнений

Небольшой тест на глазомер.
Ниже частота наступления осложнений из информированного согласия (реального):

5%
0.5%
4,2%
6.7%
3.4%
22%

Давайте сделаем заведомо неверное предположение что все осложнения независимы, сразу два осложнения у одного пациента встречается пренебрежимо редко и зададимся вопросом «какова вероятность что после операции не наступит осложнений»?

Только, чур, на глаз 🧐

Ответ: 63,7% (проверяйте!)

А теперь, собственно, сама история.

Собеседовал DS из страховой (а мб и лизинговой) компании, попросил рассказать про кейс.
А уж его кандидат выбрал что надо: кластеризовать водителей по манере езды — найти лихачей и тех, кто экономит топливо.

Моей радости не было предела — ну наконец-то, разумное применение кластеризации!

Можно же по каждому построить распределение скоростей / ускорений в каком-то небольшом окне, а дальше у нас в руках очень разумная метрика — расстояние между распределениями (тот же PSI сгодится) — и кластеризируй на здоровье.
Не дожидаясь начала ответа, осыпал кандидата комплиментами)

Оказалось весьма преждевременно 😔:
Взяли много разных табличных фичей (включая даже цену автомобиля) и накинули k-means с евклидовым расстоянием 😬
Ну хоть про локоть / силуэтт сказала, не вспомнив что есть что.

Когда так делают, мне просто физически больно.
К сожалению, ЭТО (не буду писать ругательства) часто встречается.

Эффекты масштаба (как фичи друг относительно друга отмасштабируешь, такие кластеры и получишь) и проклятие размерности и начисто игнорируются.

Когда же все-таки делать кластеризация (именно unsupervised задачу)?
Например,
- когда фичи равнозначны и в одном масштабе (гео — широта и долгота подходят пд такие фичи)
- или когда есть разумная функция расстояния между объектами и мы умеем ее вычислять
- или когда данные в виде эмбеддингов, уже обученных на близость (см. Metric Learning)
- или когда есть разумные предположения почему эмбеддинги близких объектов будут близки по расстоянию
  • 👍 27
  • 🔥 9
  • ❤ 3
  • 🤝 1
  • 🦄 1
More from @datarascals
  1. Sep 25, 2026#ML Есть у меня искренняя убежденность что Knowledge Graphs все же не самый плохой подход…
  2. Sep 22, 2026Протестируй своё решение на задаче и данных от ПАО «Интер РАО» На хакатоне ты создашь умно…
  3. Sep 20, 2026#ML #корпшиза Про регэкспы В комментах к посту про IFы в проде вспомнили про регэкспы. Ест…
  4. Sep 17, 2026Из серии «подслушано у кулера» — У нас в проектном офисе уже больше 50 человек! — А почему…
  5. Sep 17, 2026утренний ребус тщеславия оригинал
  6. Sep 16, 2026ODS умеет удивлять
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →