TGViewer
Channel Public Channel
Data Funk

Data Funk

@datafunk

Subscribers
251
Photos
201
Videos
2
Links
80

Showing posts older than #180 · Back to latest

Older Posts 17 shown
Post #179 186
Last click. В графе bfs делает 1 шаг назад и получаем список наиболее "свежих" терминов, которые послужили базой формирования слов русского языка. Среди них славянские (proto-slavic и old east slavic) вместе составляют всего 1/5 от всех языковых источников.
Post #178 168
Борьба за чистоту языка выглядит интереснее если к ней каждый раз прилагать этимологический корпус на 2М+ терминов c графом языковых заимствований. В русском языке до трети слов это комбинации уже существующих, за их исключением, вклад других языков можно оценить используя классические модели атрибуции из маркетинга.
Post #177 251
Из неожиданного: пока искал как статистически сравнить два n-мерных массива, наткнулся на многомерную версию t-теста: https://en.wikipedia.org/wiki/Hotelling%27s_T-squared_distribution
Wikipedia Hotelling's T-squared distribution multivariate probability distribution related to the F-distribution; the distribution of a set of sample statistics that are generalizations of the statistics underlying the Student's t-distribution
  • 🔥 1
Post #173 218
Хумус в германии чуть более жирный, чем в канаде. Французские блинчики в среднем содержат больше белков, а в испанской арахисовой пасте меньше углеводов, чем в аналогичных продуктах США. Бельгийская салями менее жирная чем испанская.
Датасет взят тут -> https://www.kaggle.com/datasets/arturlange/openfoodfacts-products
Post #172 185
Апельсиновый сок (не считая воды) почти весь из углеводов независимо от географии.
Post #171 175
Тернарная диаграмма полезна для относительного отображения трех переменных (x,y,z) на двумерной плоскости (с условием x+y+z=100), например можно наглядно сравнивать пищевую ценность (количество белков, жиров, углеводов) по схожим продуктам из разных стран используя данные OpenFoodFacts.
Post #170 292
На графике изменение плотности населения стран и отношения числа женщин к числу мужчин с 1950 по 2022 и далее рогноз до 2100. Несмотря на то, между этими демографическими параметрами имеется небольшая положительная корреляция, для каждой странны в отдельности с течением времени она так же не большая, но отрицательная. Это один из наглядных примеров парадокса Симпсона. На историческом промежутке до 2022 сильнейшую положительную связь между указанными показателями продемонстрировали Уругвай, Шри-Ланка и Бразилия, а отрицательную Великобритания, Россия и Австрия.

Датасет взят тут -> https://www.kaggle.com/datasets/ahmedemadeldin/world-population-2022-by-sex-cleaned
Post #169 186
ping
  • 🤯 2
Post #168 296
Остальные компоненты сохраняют в себе движущиеся элементы видео.
  • 👍 7
Post #167 276
С помощью PCA выделяем первую компоненту и этого достаточно для идентификации фона.
  • 👍 1
Post #166 238
Разворачиваем каждый кадр (трехмерный тензор) в вектор и собираем их по времени (здесь три полосы это три цветовых канала).
Post #165 211
PCA часто используется для скучного проецирования эмбедингов в пространство меньшей размерности или борьбы с мультиколлинеарностью. Но он также умеет удалять статичный фон на видео, например на этом.
Post #164 189
Комплексное преобразование Фурье позволяет разложить двумерную картинку на множество гармонических компонент. Собрал их обратно, добавляя по одной, пока не появится исходный портрет Стива Джобса.
  • 🔥 8
Post #163 371
В базе публикаций Scopus можно оценить как меняется тематика статей по множеству направлений исследований. На картинке пятилетняя динамика топ-3 тегов, отсортированных по pagerank на графах ключевых слов используемых в статьях Computer Science. В публикациях прекращают использовать ранее популярные термины вроде сложных или нейронных сетей и теперь это просто глубокое обучение. Кроме deep learning сохраняют популярность работы связанные с блокчейном и интернетом вещей. С другой стороны стали уделять меньше внимания алгоритмам и оптимизации. Быстро теряет популярность употребление слова human - современные модели больше не сравнивают с человеком.

Датасет взят тут -> https://www.kaggle.com/datasets/ammarabbasi/scientific-publication-khalifa-university-sci-tech
  • 👍 3
Post #162 269
Эйнштейн. Генетический алгоритм, 100 кругов, 2000 итераций.
С картинками в ЧБ и без лишнего фона получается чуть лучше.
  • 👍 2
Post #160 217
Я тоже немного поэкспериментировал с картинками и с помощью генетического алгоритма и кружков отрисовал Райана Гослинга (если смотреть очень из далека). 100 кругов, чуть менее 2000 итераций.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →