TGViewer
Channel Public Channel
Big Data Science [RU]

Big Data Science [RU]

@bdscience_ru

Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Subscribers
1.62K
Photos
80
Videos
9
Links
545

Showing posts older than #245 · Back to latest

Older Posts 18 shown
Post #242 784

Forwarded from Digital Dinner

Канадский художник Барри создал артбук из 1000 необычных изображений роботов.

Автор создал все изображения в этой книге, написав оригинальные подсказки для DALL·E 2, системы искусственного интеллекта OpenAI, которая может создавать реалистичные изображения и рисунки из описания на естественном языке. После создания изображений автор курировал и размещал изображения по своему вкусу.
https://archive.org/details/1111101000-robots/page/198/mode/2up
  • 🔥 2
Post #241 741
🕸✍🏻3 Python- библиотеки для работы с URL
Задача обработки URL-адресов на практике встречается довольно часто. Например, составить список наиболее часто посещаемых сайтов или тех, визиты на которые разрешены в рабочее время с корпоративных компьютеров. Для автоматизации подобных кейсов пригодятся следующие Python- библиотеки:
• Yarl – позволяет извлекать фичи из URL-адреса, предоставляет удобный класс для анализа и изменения адреса веб-ресурса. Но работает только с Python 3 и не принимает логические значения в API – необходимо самостоятельно преобразовывать логические значения в строки, используя нужный протокол перевода. https://github.com/aio-libs/yarl
• Furl – упрощает разбор и манипулирование URL-адресами. Библиотека имеет широкий набор возможностей, но и ряд ограничений. В частности, объект furl может изменяться, поэтому могут случиться проблемы при передаче его во вне. https://github.com/gruns/furl
• URLObject – служебный класс для управления URL-адресами с помощью понятного API с фокусом на правильных именах методов, а не на переопределениях операторов. Сам объект здесь неизменяем, каждое изменение URL-адреса создает новый объект URL-адреса. Но библиотека не выполняет никаких преобразований декодирования/кодирования, с чем приходится пользователю разбираться самостоятельно. https://github.com/zacharyvoase/urlobject
GitHub GitHub - aio-libs/yarl: Yet another URL library Yet another URL library. Contribute to aio-libs/yarl development by creating an account on GitHub.
  • 👍 2
Post #240 694
С практической точки зрения особенно важно, что реализация Z-скоринга очень проста: ее можно написать как небольшой программный скрипт или даже набор SQL-запросов, чтобы быстро получить легковесный MVP и оперативно проверить гипотезу.
https://towardsdatascience.com/anomaly-detection-in-sql-2bcd8648f7a8
Medium Anomaly Detection in SQL How to implement fast, powerful, anomaly detection models directly in the data warehouse
  • 🔥 5
  • 👍 1
Post #239 667
Простое и быстрое обнаружение аномалий методом Z-скоринга
Обнаружение аномалий — довольно распространенная проблема, которая охватывает множество сценариев, от финансовых мошенничеств до сбоев в компьютерной сети. Некоторые проблемы требуют сложных моделей машинного обучения, но чаще всего достаточно каких-то более простых и дешевых методов. Например, есть данные о продажах за период времени, где нужно отметить дни с аномально высокими объемами или выделить клиентов с аномально большим количеством считываний кредитной карты для проверки рисков.
Для таких случаев подойдет простой статистический метод отметки выбросов, называемый Z-скоринг. Оценка равна разнице текущего и среднего значений, разделенной на стандартное отклонение. Z-скоринг предполагает классическое нормальное распределение случайных величин. Преобразование значений в номинальной шкале в логарифмическую шкалу улучшит способность большинства ML-моделей различать взаимосвязи и улучшит способность Z-показателей отмечать выбросы.
  • 👍 5
Post #238 778
  • 🔥 8
Post #237 855
💥Зачем вам Modin: альтернатива Pandas для быстрой обработки Big Data
Обработка больших датафреймов с помощью Pandas происходит медленно, поскольку эта Python-библиотека не поддерживает работу с данными, которые не помещаются в доступную память. В результате рабочие процессы Pandas, которые хорошо работают для прототипирования нескольких МБ данных, не масштабируются до десятков или сотен ГБ реального датасета. Поэтому из-за однопоточного выполнения операций в оперативной памяти Pandas не очень подходит для обработки действительно больших наборов данных. с большими наборами данных. Есть альтернатива – Python-библиотека Modin с Pandas-подобным API, которая масштабируется по всем ядрам процессора, используя Dask или Ray движок.
Modin поддерживает работу с данными, которые не помещаются в памяти, так что вы можете комфортно работать с сотнями ГБ, не беспокоясь о существенном замедлении или ошибках памяти. Благодаря поддержке кластера и вне ядра Modin представляет собой библиотеку DataFrame с отличной производительностью на одном узле и высокой масштабируемостью в кластере.
В локальном режиме (без кластера) Modin создаст и будет управлять локальным (Dask или Ray) кластером для выполнения. При этом не нужно указывать, как распределять данные, или даже знать, сколько ядер у системы. Фактически, можно продолжать использовать код с Pandas, просто изменив оператор импорта библиотек с pandas на modin.pandas и получая значительное ускорение даже на одной машине. Modin обеспечивает ускорение до 4 раз на ноутбуке с 4 физическими ядрами.
Документация: https://modin.readthedocs.io/en/latest/index.html
Github: https://github.com/modin-project/modin
GitHub GitHub - modin-project/modin: Modin: Scale your Pandas workflows by changing a single line of code Modin: Scale your Pandas workflows by changing a single line of code - modin-project/modin
  • 🔥 5
  • 👍 1
Post #236 811
📝Валидация датафреймов с Python-библиотекой Pandera
В крупных DS-проектах для валидации датасета и проверки качества данных можно использоваться фреймворк Great Expectations. Однако, для более мелких задач нужны более простые инструменты. Например, легковесная Python-библиотека Pandera, которая явно проверяет информацию в датафреймах во время выполнения. Pandera позволяет определить схему данных один раз с помощью API на основе классов с pydantic-синтаксисом и использовать ее для проверки различных типов датафреймов, включая pandas, dask, modin и pyspark.pandas. Можно проверять типы и свойства столбцов в pd.DataFrame или значения в pd.Series, выполняйте более сложную статистическую проверку, например проверку гипотез. Из объектов схемы можно синтезировать данные для тестирования на основе свойств с помощью структур данных pandas.
Декораторы функций позволяют интегрироваться с существующими конвейерами анализа/обработки данных с помощью декораторов функций. Благодаря отложенной проверке, можно валидировать датафреймы до возникновения ошибок. Наконец, совместимость с другими Python-инструментами, таких как pydantic, fastapi и mypy, делают Pandera полезным средством для ML-разработчика и аналитика данных.
Документация: https://pandera.readthedocs.io/en/stable/
Практический пример: https://towardsdatascience.com/validate-your-pandas-dataframe-with-pandera-2995910e564
Medium Validate Your pandas DataFrame with Pandera Make Sure Your Data Matches Your Expectation
  • 👍 4
  • 🔥 1
Post #235 738
  • 👍 3
  • 🔥 2
Post #234 739
После переноса знаний из большой модели в более эффективную модель меньшего размера, чтобы преобразовать модель Pegasus в гибридную архитектуру кодировщика Transformer и декодера RNN, для повышения эффективности было уменьшено количество слоев декодера RNN. В полученной модели улучшены задержки и объем памяти, сохранив исходное качество.
https://ai.googleblog.com/2022/03/auto-generated-summaries-in-google-docs.html
Google Research Auto-generated Summaries in Google Docs Posted by Mohammad Saleh, Software Engineer, Google Research, Brain Team and Anjuli Kannan, Software Engineer, Google Docs For many of us, it can b...
  • 👍 3
Post #233 673
📝Автогенерация резюме из Google-документов
Google-документы теперь автоматически генерируют резюме их содержания. резюме содержания, когда они доступны. Хотя все пользователи могут добавлять сводки, автоматически созданные предложения в настоящее время доступны только бизнес-клиентам Google Workspace.
Это достигается за счет ML-моделей понимания естественного языка (NLU) и генерации естественного языка (NLG), особенно Transformer и Pegasus. Популярным методом объединения NLU и NLG является обучение модели машинного обучения с использованием обучения от последовательности к последовательности, где входными данными являются слова документа, а выходными данными — итоговые слова. Затем нейронная сеть учится сопоставлять входные токены с выходными токенами. Ранние приложения парадигмы последовательности к последовательности использовали рекуррентные нейронные сети (RNN) как для кодировщика, так и для декодера.
Внедрение Transformers обеспечило многообещающую альтернативу RNN благодаря внутреннему вниманию для лучшего моделирования длинных входных и выходных зависимостей, что имеет решающее значение при резюмировании документов. Тем не менее, эти модели требуют больших объемов размеченных вручную данных для достаточного обучения, поэтому одного появления Transformers было недостаточно, чтобы значительно продвинуться вперед в области суммирования документов.
Комбинация Transformers с самоконтролируемой предварительной подготовкой (BERT, GPT, T5) привела к крупному прорыву во многих задачах NLU, для которых доступны ограниченные размеченные данные. В предварительном обучении с самоконтролем модель использует большие объемы немаркированного текста, чтобы изучить общие возможности понимания языка и генерации. Затем, на последующем этапе тонкой настройки, модель учится применять эти способности к конкретной задаче, такой как подведение итогов или ответы на вопросы.
Работа Pegasus продвинула эту идею еще на один шаг вперед, введя предтренировочную цель, приспособленную к абстрактному обобщению. В предварительном обучении Pegasus, также называемом прогнозированием пробелов в предложениях (GSP), полные предложения из немаркированных новостных статей и веб-документов маскируются от входных данных, и модель требуется для их восстановления в зависимости от оставшихся немаскированных предложений. В частности, GSP пытается замаскировать предложения, которые считаются важными для документа, с помощью различных эвристик, чтобы сделать предварительную тренировку как можно ближе к задаче подведения итогов. Компания Pegasus добилась самых современных результатов на разнообразном наборе наборов данных для суммирования.
Используя преимущества Transformer и Pegasus, исследователи Google AI тщательно очистили и отфильтровали данные тонкой настройки, чтобы они содержали обучающие примеры, которые были более последовательными и представляли связное определение резюмирующего текста. Несмотря на уменьшение количества обучающих данных, это привело к более качественной модели. Затем была решена проблема обслуживания высококачественной модели в производстве. Хотя версия Transformer архитектуры кодер-декодер является доминирующим подходом к обучению моделей для задач последовательного преобразования последовательностей, таких как абстрактное суммирование, она может быть неэффективной и непрактичной для использования в реальных приложениях. Основная неэффективность связана с декодером Transformer, где токен выходной сводки генерируется последовательно посредством авторегрессионного декодирования. Процесс декодирования становится заметно медленнее, когда сводки становятся длиннее, поскольку декодер обрабатывает все ранее сгенерированные токены на каждом этапе. RNN представляют собой более эффективную архитектуру для декодирования, поскольку при использовании предыдущих токенов отсутствует внутреннее внимание, как в модели Transformer.
  • 👍 2
Post #232 695
🗣👂🏻Снижение шума в квантовых компьютерах: исследование MIT
Квантовые компьютеры очень чувствительны к шумовым помехам, которые вызываются несовершенными управляющими сигналами, возмущениями окружающей среды и нежелательными взаимодействиями между кубитами. Поэтому исследователи из MIT создали QuantumNAS - структуру, которая может идентифицировать наиболее надежную квантовую схему для конкретной вычислительной задачи и генерировать шаблон отображения, адаптированный к кубитам целевого квантового процессора. устройство. QuantumNAS требует гораздо меньше вычислительных ресурсов, чем другие методы поиска, и может идентифицировать квантовые схемы, повышающие точность задач машинного обучения и квантовой химии. В классических нейронных сетях включение большего количества параметров часто повышает точность модели. Но в вариационных квантовых вычислениях для большего количества параметров требуется больше квантовых вентилей, что вносит больше шума.
Для этого сперва была спроектирована супер-схема со всеми возможными параметризованными квантовые элементы в пространстве проектирования. Затем эта схема была обучена и использовалась для поиска схемных архитектур с высокой устойчивостью к шуму. Процесс включает в себя одновременный поиск квантовых схем и отображений кубитов с использованием эволюционного алгоритма поиска. Этот алгоритм генерирует несколько кандидатов на отображение квантовых схем и кубитов, а затем оценивает их точность с помощью модели шума или на реальной машине. Результаты возвращаются обратно в алгоритм, который выбирает наиболее эффективные части и использует их для повторного запуска процесса, пока не найдет идеальных кандидатов. Разработчики собрали полученные результаты исследования в библиотеку с открытым исходным кодом TorchQuantum https://github.com/mit-han-lab/torchquantum.
https://news.mit.edu/2022/quantum-circuits-robust-noise-0321
GitHub GitHub - mit-han-lab/torchquantum: A PyTorch-based framework for Quantum Classical Simulation, Quantum Machine Learning, Quantum… A PyTorch-based framework for Quantum Classical Simulation, Quantum Machine Learning, Quantum Neural Networks, Parameterized Quantum Circuits with support for easy deployments on real quantum compu...
  • 👍 2
Post #231 766
  • 🔥 4
  • 🤔 2
Post #230 875
🙌🏻Генерация трехмерных сцен из 2-мерных фото с NeRF от NVIDIA
Инверсный рендеринг давно использует ИИ для аппроксимации поведения света в реальном мире, что позволяет реконструировать 3D-сцену из нескольких 2D-изображений, снятых под разными углами. Исследовательская группа NVIDIA разработала подход, который решает эту задачу почти мгновенно, сочетая сверхбыстрое обучение нейронной сети и быстрый рендеринг.
NVIDIA применила этот подход к популярной новой технологии, называемой нейронными полями излучения, или NeRF. Результат, получивший название Instant NeRF, является самой быстрой технологией NeRF на сегодняшний день, достигающей в некоторых случаях более чем 1000-кратного ускорения. Модели нужно всего несколько секунд, чтобы обучиться на нескольких десятках неподвижных фотографий — плюс данные о ракурсах камеры, с которых они были сделаны — и затем она может визуализировать результирующую 3D-сцену в течение десятков миллисекунд.
NeRF используют нейронные сети для представления и рендеринга реалистичных 3D-сцен на основе входной коллекции 2D-изображений. Сбор данных для передачи NeRF напоминает работу фотографа на красной ковровой дорожке: нейросети надо несколько десятков изображений, сделанных с разных точек сцены, а также положение камеры каждого из них.
Обычно создание 3D-сцены традиционными методами занимает несколько часов или больше, в зависимости от сложности и разрешения визуализации. Внедрение ИИ в картину ускоряет работу. Ранние модели NeRF рендерили четкие сцены без артефактов за несколько минут, но на обучение уходили часы. Instant NeRF сокращает время рендеринга на несколько порядков. Он основан на кодировании хэш-сетки с несколькими разрешениями, которая оптимизирована для эффективной работы на графических процессорах NVIDIA. Так можно добиться высококачественных результатов, используя быструю и небольшую нейронную сеть.
Модель разработана с использованием набора инструментов NVIDIA CUDA и библиотеки нейронных сетей Tiny CUDA. Благодаря легковесности нейросеть можно обучить и запустить на одном графическом процессоре NVIDIA — быстрее всего она работает на картах с тензорными ядрами NVIDIA.
Эта технология пригодится для обучения роботов и беспилотных автомобилей, чтобы они могли понимать размер и форму объектов реального мира путем захвата их 2D-изображений или видеозаписей. Его также можно использовать в архитектуре и развлечениях для быстрого создания цифровых представлений реальных сред, которые создатели могут изменять и использовать.
https://blogs.nvidia.com/blog/2022/03/25/instant-nerf-research-3d-ai/
NVIDIA Blog NVIDIA Research Turns 2D Photos Into 3D Scenes in the Blink of an AI Instant NeRF is a neural rendering model that learns a high-res 3D scene in seconds — and can render images of it in a few milliseconds.
  • 👍 2
Post #229 783
🌸В нестабильном мире любимая профессия остается стабильной - повышаем свой профессиональный уровень. Главные апрельские Data Science ивенты 2022:
• 4 апреля
- Greenplum Community Meetup, Москва, Мулен Руж https://cloud.yandex.ru/events/485
• 5 апреля - конференция «Цифровизация промышленности 2022» от CNews https://events.cnews.ru/events/it_v_promyshlennosti__ot_avtomatizacii_k_cifrovizacii.shtml
• 6 апреля - Конференция Banks IT Day от TAdviser https://www.tadviser.ru/index.php/Конференция:Конференция_Banks_IT_Day_2022
• 7 апреля - конференция «Большие данные и бизнес-аналитика 2022» от CNews https://events.cnews.ru/events/bolshie_dannye_i_biznes_analitika_2022.shtml
• 12-14 апреля - Конференция Retail TECH 2022, Москва, Центр Международной Торговли, Краснопресненская наб., д. 12 https://retailtech.ru/retailtech2022/
yandex.cloud Greenplum Community Meetup Большой митап для тех, кто уже работает или собирается разобраться с консистентным анализом данных, используя Greenplum.
  • 👍 3
Post #228 743
  • 🔥 4
Post #227 807
🦋Полезные ML-сервисы: Everypixel API для распознавания изображений
Продолжаем знакомиться с полезными ML-инструментами. Встречаем Everypixel API - простой, но мощный метод визуального распознавания, который использует машинное обучение для понимания изображений.
API использует набор предварительно обученных моделей, которые анализируют изображения и возвращают полезную информацию. Он обрабатывает изображения, а затем помечает их соответствующими ключевыми словами, что помогает в их категоризации и модерации. Кроме того, он оценивает изображения в соответствии с их качеством и эстетической ценностью. Отлично подходит для интернет-магазинов и маркетплейсов, чтобы дополнить данные о продуктах и изображениях. Позволяет загружать изображения без написания описаний, так как они заполняются автоматически. Благодаря генерации ключевых слов для изображений, поможет в задачах SEO, а категоризация изображений улучшит поиск и навигацию по каталогам.
Плюсы Everypixel API:
• работает даже тогда, когда конечный пользователь делает снимок под неправильным углом или в условиях плохого освещения;
• видит изображения так, как их видит человек;
• может создавать ключевые слова, связанные с изображениями;
• делает выбор лучшего снимка из нескольких похожих фотографий;
• может оценивать изображения от 0 до 100 в зависимости от их качества.
Недостатки Everypixel API:
• Бесплатный план ограничен 100 запросами в день;
• не может оценивать исторические фотографии, иллюстрации или 3D-визуализации.
https://labs.everypixel.com/api
Everypixel AI Image Keywording and Tagging API Fast and extremely accurate tool for image auto tagging available via api. Best in class algorithm able to generate up to 50 keywords for each image
Post #226 804
📝Основы MLOps: 5 форматов для переноса ML-моделей
Для ML-систем важна переносимость между разными этапами жизненного цикла, от разработки до развертывания в production. Например, Data Scientist пишет код в блокнотах типа Jupyter Notebook или Google Colab. При переносе этого кода в производственную среду его следует преобразовать в легковесный формат обмена, сжатый и сериализованный, который не зависит от языка разработки. Такими форматами являются следующие:
• Pickle – бинарный вариант Python-объекта для сериализации и десериализации его структуры, т.е. преобразования иерархии объектов Python в поток байтов и наоборот;
• ONNX (Open Neural Network Exchange) - формат с открытым исходным кодом для ML-моделей, обеспечивающий общий набор операторов и универсальный формат файла для различных платформ и инструментов. ONNX-формат описывает граф вычислений (ввод, вывод и операции) и является автономным. Он ориентирован на глубокое обучение, поддерживается Microsoft и Facebook, отлично работает с TensorFlow и PyTorch.
• PMML (Predictive Model Markup Language) — формат обмена предиктивными моделями на основе XML, позволяющий разработать модель в одной системе для одного приложения и развернуть ее в другой с помощью другого приложения, передав конфигурационный XML-файл.
• PFA (Portable Format for Analytics) – стандарт для статистических моделей и механизмов преобразования данных, который отличается легкостью переносимости между различными системами и моделями. Функции предварительной и последующей обработки могут быть объединены в цепочку и встроены в сложные рабочие процессы. PFA может быть простым преобразованием необработанных данных или сложным набором параллельных моделей интеллектуального анализа данных с файлом конфигурации JSON или YAML.
• NNEF (Neural Network Exchange Format) – формат, который облегчает процесс развертывания машинного обучения, позволяя использовать набор инструментов обучения нейросетей для приложений на различных устройствах и платформах.
Также есть форматы, специфичные для отдельных фреймворков, например, POJO/MOJO для AutoML-платформы H2O и Spark MLWritable для Apache Spark.
  • 👍 5
Post #225 1.2K
Что в глубинах Data Lake?
 
На Хабр вышел отличный текст от технического руководителя Core Data Lake центра Big Data МТС о том, какие слои находятся внутри Data Lake, как построить архитектуру базы данных и чем распределенный Data Mesh-подход отличается от монолитного хранения данных.
 
В статье автор рассказал о задачах, архитектуре и проблемах развития Data lake, а также представил способы решения возникающих проблем, специфику процессов и перспективы развития.
 
Читать тут.
Habr Что в глубинах Data Lake? Строим архитектуру, укладываем слои, распределяем ответственность Привет, Хабр! Меня зовут Григорий Коваль, я технический руководитель Core Data Lake центра Big Data МТС . Сегодня я расскажу о том, какие слои находятся внутри Data Lake, как построить архитектуру...
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →