TGViewer
Channel Public Channel
Big Data Science [RU]

Big Data Science [RU]

@bdscience_ru

Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Subscribers
1.62K
Photos
80
Videos
9
Links
545

Showing posts older than #424 · Back to latest

Older Posts 16 shown
Post #423 1.01K
😎Книги по DS для самых "новеньких"
1. Наука о данных. Джон Келлехер, Брендан Тирни
- в книгу включены основные аспекты, от момента становления сбора и анализа данных, до решения этических конфликтов, нарастающих из-за политики конфиденциальности. Читателю расскажут, как ведут работу нейронные сети и машинное обучение, приведут примеры изучения бизнес-проблем и покажут пути их решения. Дополнительно расскажут о тех областях, на которые наука о данных может повлиять в большей степени.
2. Практическая статистика для специалистов Data Science. Питер Брюс, Эндрю Брюс - Практический учебник представлен для специалистов в сфере данных, обладающих навыком работы с языком программирования и знакомых с определением математической статистики. Здесь в доступном виде представлены основные моменты из статистики науки о данных, также объясняется, какие критерии необходимы и полезны со стороны анализа данных.
3. Изучаем Spark. Холден Карау, Матей Захария, Патрик Венделл, Энди Конвински - Авторами книги являются разработчики системы Spark. Они расскажут об организации параллельного выполнения заданий с помощью нескольких строчек кода, также помогут разобраться в системе на примерах.
4. Data Science. Наука о данных с нуля. Джоэл Грас - Джоэл Грас рассказывает о языке Python, элементах линейной алгебры, математической статистике, методах сбора, нормализации и обработки данных. Дополнительно даёт информационную базу для машинного обучения. Описывает математические модели и пути их разработки по принципу «k».
5. Основы Data Science и Big Data. Дэви Силен, Арно Мейсман, Мохамед Али - Читателя познакомят с теоретической основой, последовательностью машинного обучения, работой с большими массивами данных, NoSQL, детальным анализом текстов и визуальной информацией. В качестве примеров представлены сценарии Data Science на Python.
  • 👍 4
Post #418 818

Forwarded from Digital Dinner

🥳«Яндекс» выпустил бета-версию нейросети «Шедеврум»
«Яндекс» запустил прототип собственной нейросети для генерации картинок по текстовым запросам пользователей. Бета-версия 0.1.4 приложения «Шедеврум» доступна для скачивания на Android и iOS.

«Шедеврум” понимает русский и английский языки и очень любит конкретику. Чем подробнее описание, тем точнее результат. Нейросеть учитывает особые пожелания (например, «фотореализм» или «высокая детализация»), способна подражать известным живописцам и работать в заданных художественных стилях».

Нейросеть формирует изображения по методу каскадной диффузии. Сначала она создает картинки в соответствии с запросом, а затем поэтапно увеличивает их разрешение, насыщая деталями.

Примеры изображений, сгенерированных нейросетью «Шедеврум»
Post #417 835
😎ТОП-7 майских ивентов в Data Science
19-20 мая
- Positive Hack Days 12 - Москва, Россия - https://www.phdays.com/ru/
22-24 мая - SPATIAL DATA - Москва, Россия - https://scidata.ru/
24 мая - РИФ 2023 - Москва, Россия - https://rif.ru/
25 мая - Дата Саммит «Вселенная ваших данных» - Москва, Россия - https://data-summit.ru/
27-28 мая - CodeFest 13 - Новосибирск, Россия - https://13.codefest.ru/
30 мая - TAdviser SummIT - Москва, Россия - https://summit.tadviser.ru/
31 мая - TECH WEEK - Москва, Россия - https://techweek.moscow/
phdays.com Positive Hack Days Fest Международный киберфестиваль для всех, кто хочет погрузиться в мир кибербезопасности. Любой желающий может узнать, как устроен цифровой мир, повысить уровень своей защищенности и круто провести время
Post #416 941
😳Опубликован датасет для обучения усовершенствованной альтернативы LLaMa
Группа исследователей из различных организаций и университетов (Together, ontocord.ai, ds3lab.inf.ethz.ch, crfm.stanford.edu, hazyresearch.stanford.edu, mila.quebec) работает над созданием open-source альтернативы модели LLaMa и уже опубликовали датасет, релевантный использованному для создания последней. Несвободная, но хорошо сбалансированная LLaMa использовалась в качестве основы для таких проектов как Alpaca, Vicuna и Koala.
Сейчас в открытом доступе опубликован RedPajama – датасет текстов, содержащий более 1,2 трлн токенов. Следующим шагом,  по словам разработчиков, будет создание самой модели, что потребует серьёзных вычислительных мощностей.
GitHub GitHub - togethercomputer/RedPajama-Data: The RedPajama-Data repository contains code for preparing large datasets for training… The RedPajama-Data repository contains code for preparing large datasets for training large language models. - togethercomputer/RedPajama-Data
  • 👍 3
Post #415 994
😩Неопределенность в данных: распространенные баги
Сейчас активно обсуждают «подготовку данных» и «очистку данных», но что отличает высококачественные данные от низкокачественных?
В большинстве систем машинного обучения сегодня применяется контролируемое обучение. Это значит, что данные обучения состоят их пар (input, output), и мы хотим, чтобы система могла получать входные данные и сопоставлять их с выходными. Например, входными данными может быть аудиоклип, а выходными — транскрипция речи. Для создания таких наборов данных необходимо грамотно их размечать. Если в разметке данных присутствует неопределённость, то для достижения высокой точности модели машинного обучения может понадобиться больше данных. Сбор и аннотирование данных могут оказаться некорректными по следующим причинам:
1. Простые ошибки аннотирования. Простейший тип ошибки — это неправильное аннотирование. Аннотатор, уставший от большого количества разметки, случайно помещает пример данных не в тот класс. Хоть это и простая ошибка, она встречается довольно часто, и может иметь огромное отрицательное влияние на производительность системы ИИ.
2. Несоответствия в руководствах по аннотированию. В аннотировании элементов данных часто присутствуют различного вида тонкости. Например, можно представить, что необходимо читать посты в социальных сетях и аннотировать, являются ли они обзорами продуктов. Задача кажется простой, но если начать аннотировать, можно осознать, что «продукт» — это довольно расплывчатое понятие. Нужно ли считать продуктами цифровые медиа, например, подкасты или фильмы? Один специалист может сказать «да», другой «нет», поэтому точность системы ИИ может сильно снижаться.
3. Несбалансированные данные или отсутствующие классы. Способ сбора данных сильно влияет на состав наборов данных, что в свою очередь может повлиять на точность моделей на конкретных классах или подмножествах данных. В большинстве наборов данных из реального мира количество примеров в каждой категории, которые мы хотим классифицировать (баланс классов) может сильно варьироваться. Это может приводить к снижению точности, а также к усугублению проблем баланса и перекосам. Например, система распознавания лиц ИИ Google была печально известна тем, что плохо распознавала лица цветных людей, что в большой степени было результатом использования набора данных с недостаточно разнообразными примерами (среди множества прочих проблем).
  • 👍 1
  • 🤯 1
Post #414 973
🧐Что такое наблюдаемость данных: основные принципы
Наблюдаемость данных - это новый уровень в современном стеке технологий обработки данных, обеспечивающий командам по работе с данными их прозрачность и качество. Цель наблюдаемости данных - уменьшить вероятность ошибок в бизнес-решениях из-за некорректной информации в данных.
Наблюдаемость обеспечивается следующими принципами:
Свежесть (Freshness) показывает, насколько актуальны структуры данных.
Распределение (Distribution) сообщает, попадают ли данные в ожидаемый диапазон.
Объем (Volume ) предполагает понимание полноты структур данных и состояния источников данных.
Схема (Schema) позволяет понять, кто и когда вносит изменения в структуры данных.
Происхождение (Lineage) сопоставляет вышестоящие источники и нижележащие приемники данных, помогая определить, где произошли ошибки или сбои.
Подробнее о наблюдаемости данных в источнике: https://habr.com/ru/companies/otus/articles/559320/
Post #413 1.12K
😎🥹Библиотеки для комфортной работы с данными
PyGWalker - упрощает рабочий процесс анализа и визуализации данных в Jupyter Notebook, превращая фрейм данных pandas в пользовательский интерфейс в стиле Tableau для визуального исследования.
SciencePlots - библиотека для создания различных графиков matplotlib для презентаций, исследовательских работ и т.д.
CleverCSV - библиотека, которая устраняет различные ошибки синтаксического анализа при чтении CSV-файлов с помощью Pandas
fastparquet - ускоряет ввод-вывод pandas примерно в 5 раз. fastparquet - это высокопроизводительная реализация формата Parquet на Python, предназначенная для бесперебойной работы с фреймами данных Pandas. Она обеспечивает быструю производительность чтения и записи, эффективное сжатие и поддержку широкого спектра типов данных.
Feather - библиотека, которая предназначена для чтения и записи данных с устройств. Данная библиотека отлично подходит для перевода данных из одного языка в другой. Также она способна достаточно быстро считывать большие массивы данных
Dask - эта библиотека позволяет эффективно организовывать параллельные вычисления. Коллекции больших данных хранятся  здесь как параллельные массивы/списки и позволяют работать с ними через Numpy/Pandas
Ibis - обеспечивает доступ между локальным окружение в Python и удаленными хранилищами данных (например, Hadoop)
GitHub GitHub - Kanaries/pygwalker: PyGWalker: Turn your dataframe into an interactive UI for visual analysis PyGWalker: Turn your dataframe into an interactive UI for visual analysis - Kanaries/pygwalker
  • 👍 6
Post #412 984
😳Подборка Python-библиотек для случайной генерации тестовых данных
Многие любят Python за его удобство в обработке данных. Но иногда бывает, что необходимо написать и проверить алгоритм по определенной тематике, но самих данных по этой тематике мало или вовсе нет в открытом доступе. Для таких целей существуют библиотеки с помощью которых можно генерировать фейковые данные с нужными типами.
Faker - библиотека для генерации различных типов случайной информации. Он также имеет интуитивно понятный API. Существуют также реализации для таких языков, как PHP, Perl и Ruby.
Mimesis - это библиотека для языка Python, которая помогает генерировать данные для различных целей. Библиотека написана с использованием средств, включенных в стандартную библиотеку языка Python, потому не имеет никаких сторонних зависимостей.
Radar - Библиотека для генерации случайных дат и времени
Fake2db - библиотека, которая позволяет генерировать данные напрямую в базе данных (также существуют движки для разных СУБД).
GitHub GitHub - joke2k/faker: Faker is a Python package that generates fake data for you. Faker is a Python package that generates fake data for you. - joke2k/faker
Post #411 1.1K
📝Подборка источников с медицинскими датасетами
Международная система здравоохранения ежедневно генерирует множество медицинских данных, которые (по крайней мере, теоретически) можно использовать для машинного обучения.
Вот несколько источников с медицинскими наборами данных:
1. The Cancer Imaging Archive (TCIA), финансируемый Национальным институтом онкологии США (NCI) — это место хранения в открытом доступе радиологических и гистопатологических снимков
2. National Covid-19 Chest Imaging Database (NCCID), являющаяся частью AI Lab Государственной службы здравоохранения Великобритании (NHS), содержит рентгенограммы, снимки МРТ и КТ органов грудной клетки пациентов больниц по всей Великобритании. Это один из крупнейших архивов такого типа, вклад в который вносят 27 больниц и фондов.
3. Medicare Provider Catalog собирает официальные данные центров услуг Medicare и Medicaid (CMS). Он охватывает множество различных тем, от качества ухода в разных больницах, центрах реабилитации, хосписах и других учреждениях здравоохранения, до стоимости посещения и информации о врачах и клиницистах. Данные можно просматривать в браузере, скачивать конкретные датасеты в формате CSV или подключать собственные приложения к веб-сайту при помощи API.
4. Older Adults Health Data Collection на Data.gov состоит из 96 датасетов, управляемых федеральным правительством США. Его основное предназначение — сбор информации о здоровье людей старше 60 лет в контексте пандемии Covid-19 и вне его. Среди организаций, занимающихся поддержанием коллекции, Департамент здравоохранения и социального обеспечения США, Департамент по делам ветеранов, центры по контролю и профилактике заболеваний (CDC) и другие. Датасеты можно скачивать в различных форматах: HTML, CSV, XSL, JSON, XML и RDF.
5. The Cancer Genome Atlas (TCGA) — это важнейшая база данных геномики, охватывающая 33 типа заболеваний, в том числе 10 редких.
6. Surveillance, Epidemiology, and End Results (SEER) — самый надёжный источник онкологической статистики в США, предназначенный для снижения доли раковых заболеваний в популяции. Её база данных поддерживается Surveillance Research Program (SRP), которая является частью Division of Cancer Control and Population Sciences (DCCPS) Национального института онкологии.
www.cancer.gov The Cancer Genome Atlas Program (TCGA) The Cancer Genome Atlas (TCGA) is a landmark cancer genomics program that sequenced and molecularly characterized over 11,000 cases of primary cancer samples. Learn more about how the program transformed the cancer research community and beyond.
  • 👍 2
Post #410 877
😎Искать данные и параллельно учить SQL-легко!!!
Census GPT — это инструмент, который позволяет пользователям осуществлять поиск данных о городах, микрорайонах и других географических зонах.
Используя технологию искусственного интеллекта, Census-GPT упорядочил и проанализировал огромные объемы данных для создания супербазы данных. В настоящее время база данных Census-GPT содержит информацию о Соединенных Штатах, где пользователи могут запрашивать данные о населении, уровне преступности, образовании, доходе, возрасте и т.д. Кроме того, Census-GPT может отображать карты США в четкой и лаконичной форме.
На сайте Census GPT пользователи также могут улучшать существующие карты. Результаты данных можно получить вместе с SQL-запросом. Соответственно, можно учить SQL и автоматически проверять себя на реальных примерах.
Censusgpt Census GPT Search the census database with natural language
  • 🥰 4
  • 👍 1
Post #409 896

Forwarded from Аналитика больших данных (Very Big Anal)

😔Россияне боятся потерять работу из-за развития искусственного интеллекта

По результатам опроса, развития искусственного интеллекта боятся 17% россиян. В качестве аргумента чаще всего упоминается риск потери рабочих мест в результате автоматизации.

При этом 43% россиян не испытывают страха, связанного с развитием искусственного интеллекта. Большинство из них уверены, что нейросети никогда не смогут заменить человека.

Согласно исследованиям, наибольший риск потери работы из-за развития искусственного интеллекта ощущают переводчики, менеджеры по туризму и официанты. Меньше всего эта проблема беспокоит врачей, строителей и учителей.

Отмечается, что всего в опросе сервиса приняли участие 1,6 тыс. представителей экономически активного населения из всех округов страны.
Post #408 1.01K

Forwarded from Аналитика больших данных (Very Big Anal)

Поисковик Bing снова популярен, благодаря Chat GPT
Использование технологии от OpenAI поднял ежедневную активность пользователей в Bing в 6 раз, а общая дневная аудитория выросла до 100 000 000.

Вместе с популярностью Bing возрос и интерес к Edge – браузеру от Microsoft.
В течение 20 лет в поисковой системе Bing не производилось никаких серьезных изменений. Это привело к тому, что порядка 40% пользователей сталкивались с одной общей проблемой – ссылки при нажатии просто не работали.

Microsoft решила инвестировать средства в OpenAI – компанию-разработчика ChatGPT – и внедрить технологию ИИ в свою поисковую систему. Это сделало ее первой IT-корпорацией, которая решилась на подобную интеграцию.
Post #407 1.07K
🔥ТОП-5 апрельских ивентов в Data Science
6 апреля
- Data Day 2023 - Москва, Россия - https://data-day.ru/
11-14 апреля - РНВТ–2023 - Москва, Россия - https://hi-techweek.ru/
13-14 апреля - DATA FUSION - Онлайн - https://data-fusion.ru/
16-17 апреля - Heisenbug 2023 - Москва, Россия - https://heisenbug.ru/
18 апреля - First Russian Data Forum 2023 - Москва, Россия - https://data-forum.ru/
data-day.ru Форум Data Day 2027. ИИ + ДАННЫЕ. Как сохранять уверенный курс в динамичной среде 8 июля, Москва
Post #406 789
🤓Что такое синтетические данные и зачем их используют?
Синтетические данные
— это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
  • 🤔 1
Post #405 727
🤔Что такое Data Mesh: суть концепции
Data Mesh
- это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
  • 👍 2
Post #403 941
💥YTsaurus: система для хранения и обработки Big Data Яндекса стала open-source
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;

В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.

В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
  • 👍 2
  • 🔥 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →