TGViewer
Data Funk Data Funk @datafunk · 251 subscribers
Post #243 4.13K
Желание разложить что-угодно по группам на основе схожести - естественная черта человека, но задача кластеризации данных, почти всегда как плохое ТЗ для дизайнера - делай красиво, а не красиво не делай. Какой алгоритм кластеризации хороший, а какой плохой если сравнивать результат их работы не с чем? Джон Клейнберг из Корнеллского университета в 2002 году сформулировал три критерия хорошего алгоритма кластеризации:

- Масштабная инвариантность. Если все расстояния между точками умножить на положительное число, это не должно менять результат работы хорошего алгоритма.
- Насыщенность/разнообразие. Хороший алгоритм способен создать любую произвольную комбинацию разбиения входных данных.
- Согласованность. Если уменьшаем внутрикластерные расстояния и/или увеличиваем межкластерные, алгоритм должен возвращать то же разбиение на кластеры.
  • 🔥 3
More from @datafunk
  1. Sep 14, 2026Post #293
  2. Sep 6, 2026Post #292
  3. Jul 10, 2026Команда из École Normale Supérieure (🇫🇷) собрала CalArena - один из самых больших бенчма…
  4. Jun 17, 2026Листаю статьи про A/B и ML, и это будто две разные вселенные. Только в Causal ML они хоть…
  5. Jun 7, 2026Что по плюсам: Скорость: Это в разы быстрее любых других методов. Строгость: На руках чест…
  6. Jun 7, 2026В прошлом году открыл статью, пробежался по диагонали и закрыл. А недавно увидел ее снова…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →