TGViewer
Channel Public Channel
Big Data Science [RU]

Big Data Science [RU]

@bdscience_ru

Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Subscribers
1.62K
Photos
79
Videos
9
Links
544

Showing posts older than #575 · Back to latest

Older Posts 20 shown
Post #574 663
💡🔎Platform Extension Framework (PXF): преимущества и недостатки
Platform Extension Framework (PXF) - это мощный инструмент, предоставляемый многими современными платформами для расширения их функционала. PXF позволяет разработчикам создавать плагины и дополнения, которые интегрируются в основную платформу, обеспечивая гибкость и расширяемость системы.
К его достоинствами можно отнести:
1. Проверенное временем решение на базе открытого исходного кода c возможностью доработки под свои потребности
2. Модульность: PXF позволяет разделить функциональность на независимые модули. Это упрощает разработку, тестирование и обслуживание кода.
3. Расширяемость: С помощью PXF можно легко добавить новые возможности или интегрироваться с внешними сервисами и инструментами, что позволяет платформе эволюционировать вместе с потребностями бизнеса.
4. Ускорение разработки: Платформы с поддержкой PXF часто предоставляют готовые инструменты и API, которые ускоряют процесс разработки и упрощают внедрение новых функций.
5. Доступный «из коробки» набор коннекторов к популярным источникам данных (Hadoop-стек, доступные через JDBC источники данных, облачные хранилища).
Но можно выделить и ряд недостатков:
1. Необходимость поддерживать обособленное решение на базе своего стека.
2. Выделение ресурсов, как правило, на тех же серверах, где развернута сама СУБД.
3. Множественное преобразование и перекладывание одних и тех же данных на пути от представления в СУБД к типам, которыми оперирует сам PXF.
4. Безопасность: Поскольку расширения могут иметь доступ к важным данным и функциям платформы, важно обеспечить их безопасность и предотвратить возможные уязвимости.
5. Совместимость: Обновления платформы могут привести к проблемам совместимости с существующими расширениями, что требует дополнительного тестирования и адаптации.

Platform Extension Framework предоставляет мощные возможности для расширения и адаптации платформ, позволяя разработчикам создавать кастомные решения и улучшать функциональность систем. Однако важно учитывать возможные сложности и риски, связанные с интеграцией и поддержкой расширений, чтобы максимально эффективно использовать потенциал PXF.
  • 👍 1
  • 🔥 1
Post #573 688
📊💡Датасет взаимодействий с ChatGPT
Wild Chat - датасет, состоящий из 1 миллиона реальных взаимодействий пользователей с ChatGPT, характеризующихся широким спектром языков и разнообразием промптов.
Он был собран путем предоставления бесплатного доступа всем желающим к ChatGPT и GPT-4 в обмен на сбор истории чатов.
Используя этот датасет, разработчики создали бота WildLlama-7b-user-assistant на базе Llama-2, который способен предсказывать как промптов пользователя, так и ответы, которые может выбрать ChatGPT.
Для загрузки датасета также можно использовать следующий скрипт:
from datasets import load_dataset
dataset = load_dataset("allenai/WildChat-1M")
huggingface.co allenai/WildChat-1M · Datasets at Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 👍 1
Post #572 724
💡🔎Не очень известные, но очень полезные ETL-сервисы
Astera Centerprise — это готовое к использованию ETL-решение корпоративного уровня, предлагающее возможности интеграции и преобразования данных для необработанные данные любой сложности и размера в различных форматах: от сложных иерархических файлов и неструктурированных документов до отраслевых форматов, таких как EDI, и даже устаревших данных, таких как COBOL.
Talend — это программная платформа с открытым исходным кодом, которая предлагает решения для интеграции и управления данными. Talend специализируется на интеграции больших данных. Этот инструмент предоставляет такие функции, как облако, большие данные, интеграция корпоративных приложений, качество данных и управление основными данными. Он также предоставляет единый репозиторий для хранения и повторного использования метаданных.
Skyvia — это веб-сервис для интеграции облачных данных и резервного копирования. Он предлагает ETL-инструменты для интеграции облачных CRM с другими источниками данных и позволяет пользователям контролировать все свои бизнес-данные. Данные можно просматривать и управлять ими с помощью SQL. Skyvia обеспечивает лёгкую интеграцию данных без навыков программирования.
Pentaho - это инструмент бизнес-аналитики, который предоставляет клиентам широкий спектр решений бизнес-аналитики. Он способен составлять отчеты, анализировать данные, интегрировать данные, извлекать данные и т. д. Pentaho также предлагает полный набор функций BI, которые позволяют повысить производительность и эффективность бизнеса.
Hevo Data — это платформа ETL, которая поддерживает интеграцию, перемещение и обработку данных. Он поддерживает широкий спектр источников данных и предлагает репликацию данных в реальном времени. Этот инструмент облегчает извлечение, преобразование и загрузку данных в назначенные целевые места назначения.
Astera Astera - AI-Powered Data Platform Astera unifies ETL, data warehousing, and document automation in one no-code platform, so your team ships reliable data and AI products faster.
  • 👍 2
Post #571 696
💡🔎📉Adversarial Validation: Преимущества и Недостатки
Adversarial Validation (AV) — это метод, который позволяет оценить, насколько тестовые данные отличаются от тренировочных данных. Это особенно полезно в задачах машинного обучения, где качество предсказаний может существенно зависеть от того, насколько хорошо распределения данных совпадают между тренировочной и тестовой выборками. Рассмотрим основные преимущества и недостатки этого подхода.
Преимущества Adversarial Validation:
1. Обнаружение несоответствий в данных:
AV помогает выявить, если тренировочные и тестовые данные сильно различаются по распределению. Это может сигнализировать о потенциальных проблемах с генерализацией модели.
2. Улучшение качества модели: Устранив различия между тренировочными и тестовыми данными, можно значительно повысить качество предсказаний модели на тестовой выборке.
3. Оптимизация выборки данных: Используя AV, можно более точно сформировать тренировочные и валидационные наборы данных, что позволит избежать переобучения и улучшить общее качество модели.
4. Идентификация утечек данных: AV помогает обнаружить случаи, когда информация из тестовой выборки "просачивается" в тренировочную, что может привести к необъективно высоким результатам модели.
Недостатки Adversarial Validation:
1. Увеличение вычислительных затрат: Для выполнения AV требуется обучение дополнительной модели (обычно это классификатор), что увеличивает вычислительные затраты и время, необходимое для анализа данных.
2. Сложность реализации: Настройка и проведение AV могут требовать значительных знаний и опыта в области машинного обучения, что может быть сложным для новичков.
3. Риск переобучения: Слишком частое использование AV для коррекции данных может привести к переобучению модели на тренировочные данные и ухудшению её способности к генерализации.
  • 👍 3
  • ❤ 1
Post #570 711
🌎ТОП июньских ивентов в Data Science
4 июня - infra.conf - Москва, Россия - https://infraevents.yandex.ru/event/infraconf2024
20 июня - NexSummIT 2024 - Москва, Россия - https://fcongress.forbes.ru/events/nexsummit-2024
21 - 23 июня - PRACTICE & SCALE AI - Онлайн - https://practice-scale.ru/
24-25 июня - Saint HighLoad++ 2024 - Санкт-Петрбург, Россия - https://highload.ru/spb/2024
26-28 июня - TECH WEEK 2024 - Москва, Россия - https://techweek.moscow/
27 июня - GigaConf - Москва, Россия - https://gigaconf.ru/
Мероприятия | Yandex Infrastructure infra.conf 2024. Инженерные истории со смыслом. Всё про создание инфраструктуры и эксплуатацию высоконагруженных систем.
Post #569 749
🔎💡Полезные репозитории GitHub для разработки мастер-данных и новичков
Awesome Data Engineering - содержит список инструментов, фреймворков и библиотек для инженерии данных, что делает его отличной отправной точкой для тех, кто хочет погрузиться в эту область.
Data Engineering Zoomcamp - это полный курс, позволяющий получить практический опыт в области инженерии данных.
The Data Engineering Cookbook - это сборник статей и учебников, посвященных различным аспектам инженерии данных, включая ввод данных, обработку данных и хранилища данных.
Awesome Open Source Data Engineering - это список инструментов для проектирования данных с открытым исходным кодом, который станет золотой жилой для всех, кто хочет внести свой вклад или использовать их для создания реальных проектов по проектированию данных. Он содержит огромное количество информации об инструментах и фреймворках с открытым исходным кодом, что делает его отличным ресурсом для тех, кто хочет изучить альтернативные решения в области инженерии данных.
Data Engineer Handbook - это всеобъемлющая коллекция ресурсов, охватывающая все аспекты инженерии данных. В него входят учебники, статьи и книги по всем темам, связанным с инженерией данных. Независимо от того, ищете ли вы краткое справочное руководство или глубокие знания, в этом справочнике найдется что-то для инженеров по обработке данных любого уровня.
Репозиторий Data Engineering Wiki - это вики, созданная сообществом, которая представляет собой всеобъемлющий ресурс для изучения инженерии данных. Этот репозиторий охватывает широкий спектр тем, включая конвейеры данных, хранилища данных и моделирование данных.
Data Engineering Practice - предлагает практический подход к изучению инженерии данных. В нем представлены практические проекты и упражнения, которые помогут вам применить свои знания и навыки в реальных сценариях. Выполняя эти проекты, вы получите практический опыт и составите портфолио, демонстрирующее ваши способности в области инженерии данных.
GitHub GitHub - igorbarinov/awesome-data-engineering: A curated list of data engineering tools for software developers A curated list of data engineering tools for software developers - igorbarinov/awesome-data-engineering
  • 👍 2
Post #568 683
📊🔎Небольшая подборочка не очень популярных, но полезных библиотек для анализа данных
PySheets - предоставляет пользовательский интерфейс электронных таблиц для Python. Используйте Pandas, создавайте диаграммы, импортируйте листы Excel, анализируйте данные и создавайте отчеты.
py2wasm - преобразует программы и данные в Python в WebAssembly и работает с ними их в 3 раза быстрее.
databonsai - это библиотека Python, которая использует LLM для задач очистки данных, таких как категоризация, преобразование и извлечение.
wasmer.io Announcing py2wasm: A Python to Wasm compiler · Blog · Wasmer Since starting Wasmer five years ago we've been obsessed with empowering more languages to target the web and beyond through Webassembly. One of the mo...
  • 👍 3
Post #567 684
💡Большой датасет отзывов
RLAIF-V-Dataset - это большой мультимодальный датасет отзывов. Набор данных построен с использованием моделей с открытым исходным кодом для обеспечения высококачественных отзывов.
Набор данных RLAIF-V-Dataset представляет собой новый метод использования MLLM с открытым исходным кодом для обеспечения высококачественной обратной связи с откликами деконфаундинговых моделей. Благодаря обучению на этих данных, модели могут достичь более высокого уровня достоверности по сравнению с существующими моделями с открытым исходным кодом.
Загрузить датасет с помощью Python-скрипта можно следующим образом:
from datasets import load_dataset
dataset = load_dataset("HaoyeZhang/RLAIF-V-Dataset")
huggingface.co openbmb/RLAIF-V-Dataset · Datasets at Hugging Face We’re on a journey to advance and democratize artificial intelligence through open source and open science.
  • 👍 3
Post #566 797
💡🔎Помощник для взаимодействия с любыми данными
Verba — это полностью настраиваемый персональный помощник для запроса и взаимодействия с вашими данными, локально или развернутыми через облако.

Он также может отвечать на вопросы, связанные с вашими документами и получать информацию из существующих баз знаний.

Verba отлично сочетает в себе современные технологии RAG и контекстно-зависимую базу данных Weaviate.
GitHub GitHub - weaviate/Verba: Retrieval Augmented Generation (RAG) chatbot powered by Weaviate Retrieval Augmented Generation (RAG) chatbot powered by Weaviate - weaviate/Verba
  • 👍 1
Post #565 675
⚔️💡MySQL vs PostgreSQL в Data Mining: преимущества и недостатки
Когда дело доходит до выбора базы данных для задач data mining, два самых популярных решения — MySQL и PostgreSQL. Оба эти СУБД имеют свои сильные и слабые стороны, и выбор между ними зависит от специфических требований проекта. Давайте рассмотрим основные преимущества и недостатки каждого из них в контексте data mining.
Преимущества MySQL:
1. Высокая производительность: MySQL известна своей быстрой производительностью при выполнении простых операций чтения и записи, что делает её подходящей для приложений с высокими нагрузками.
2. Широкая распространённость: MySQL имеет обширное сообщество и множество документации, что облегчает поиск решений и получение помощи.
3. Интеграция с веб-технологиями: MySQL часто используется в веб-разработке и имеет хорошую совместимость
Недостатки MySQL:
1. Ограниченные возможности для аналитики: MySQL менее эффективна при выполнении сложных аналитических запросов и не поддерживает некоторые продвинутые функции, такие как оконные функции, которые важны для data mining.
2. Меньшая поддержка JSON и NoSQL: Хотя MySQL имеет поддержку JSON, она не так развита, как в PostgreSQL.
3. Ограниченные транзакционные возможности: MySQL уступает PostgreSQL в плане управления сложными транзакциями и соблюдения ACID.
Преимущества PostgreSQL:
1. Мощные аналитические возможности: PostgreSQL поддерживает сложные аналитические запросы, оконные функции и CTE (Common Table Expressions), что делает её отличным выбором для data mining.
2. Поддержка JSON и NoSQL: PostgreSQL имеет продвинутую поддержку JSON и может использоваться как гибридная СУБД, что упрощает работу с полу-структурированными данными.
3. Расширяемость и совместимость: PostgreSQL легко расширяется с помощью плагинов и поддерживает множество стандартов SQL, что делает её очень гибкой.
4. Надёжность и соответствие ACID: PostgreSQL обеспечивает высокий уровень надежности данных и полного соблюдения ACID-транзакций, что важно для критически важных data mining приложений.
Недостатки PostgreSQL:
1. Сложность настройки и администрирования: PostgreSQL требует более глубокой настройки и администрирования, что может быть сложнее для новичков.
2. Производительность на простых задачах: в некоторых случаях PostgreSQL может уступать MySQL по скорости выполнения простых операций.
3. Ресурсоёмкость: PostgreSQL может требовать больше ресурсов для достижения высокой производительности, особенно в сложных сценариях.
Таким образом, выбор между MySQL и PostgreSQL для задач data mining зависит от конкретных потребностей проекта. Если нужна простая и быстрая СУБД для базовых операций и интеграции с веб-приложениями, MySQL может быть лучшим выбором. Если же проект требует сложного анализа данных, гибкости и надежности, PostgreSQL станет более подходящим вариантом.
PostgreSQL The world's most advanced open source database.
  • 👍 1
Post #564 754
💡😎Основы работы с Data-Mining: процесс, инструменты и методики
Дата-майнинг (data mining) — это процесс обработки данных для выявления паттернов, корреляций и аномалий в крупных датасетах. В нём применяются разнообразные методики статистического анализа и машинного обучения для извлечения из данных значимой информации и выводов. Компании могут использовать эти выводы для принятия обоснованных решений, прогнозирования трендов и совершенствования бизнес-стратегий.
Можно выделить такие методики дата-майнинга, как:
Деревья решений - в конце каждой ветви находится прогноз или решение. В задачах классификации эти конечные точки разделяют данные на категории
Выявление аномалий - аномалии могут возникать из-за колебаний измерений или быть показателями ошибки экспериментов; в некоторых случаях они могут указывать на важное открытие или на новый тренд
ПО для работы с дата-майнингом делится на:
1. Инструменты визуализации:
Grafana - подходит для аналитики и мониторинга в реальном времени
Google Charts — это веб-решение для создания интерактивных графиков
2. Платформы дата-майнинга:
KNIME - это аналитическая платформа, позволяющая выгружать данные из различных источников, трансформировать данные и загружать их в различные базы данных
RapidMiner - это программная многопользовательская платформа, которая представляет собой интегрированную среду для обработки данных в больших информационных массивах, машинного обучения, текстовой аналитики и построения прогностических моделей, а также для решения иных задач Data Mining.
Grafana Labs Full-stack observability for the agentic era | Grafana Labs | Grafana Labs Avoid lock-in and ensure reliability with Grafana Cloud. The AI-powered platform built on open standards unifies metrics, logs, traces, profiles, and business data.
  • 🔥 2
Post #563 696
💡😎Подборка векторных баз данных
Векторные базы данных — это особый тип баз данных, предназначенный для организации данных на основе сходства. Для этого они преобразуют исходные данные — такие как изображения, текст, видео или аудио — в математические представления, известные как многомерные векторы. Каждый вектор может иметь от десятков до тысяч измерений, в зависимости от сложности исходных данных. на данный момент существуют такие векторные БД, как:
Chroma - Это векторная база данных с открытым исходным кодом, созданная для обеспечения разработчиков и организаций любого размера ресурсами, необходимыми для создания приложений на основе больших языковых моделей (LLM). Она предоставляет разработчикам высокомасштабируемое и эффективное решение для хранения, поиска и извлечения многомерных векторов.
Одной из причин популярности Chroma является ее гибкость
Pinecone - Это облачная управляемая векторная база данных. Широкая поддержка многомерных векторов делает Pinecone подходящей для различных сценариев использования, включая поиск по сходству, рекомендательные системы, персонализацию и семантический поиск. Она также поддерживает возможность одноступенчатой фильтрации. А способность анализировать данные в реальном времени делает ее отличным выбором для обнаружения угроз и мониторинга кибератак в сфере кибербезопасности.
Weviate - Примечательной особенностью этой БД является то, что ее можно использовать для хранения как векторов, так и объектов. Это делает ее подходящей для приложений, сочетающих несколько методов поиска, таких как векторный поиск и поиск по ключевым словам.
Milvus - использует самые современные алгоритмы для ускорения процесса поиска, что позволяет быстро находить похожие векторы даже при работе с большими массивами данных.
Chroma Chroma - open-source search infrastructure for AI
  • 👍 3
Post #562 749
⚖️Apache Superset: преимущества и недостатки
Apache Superset - это инструмент визуализации данных с открытым исходным кодом, который обеспечивает богатый набор возможностей для анализа данных и создания интерактивных дашбордов.
Преимущества Apache Superset:
1. Открытый исходный код: Apache Superset разрабатывается и поддерживается сообществом, что обеспечивает высокую степень гибкости и возможность расширения под различные потребности.
2. Мощная визуализация данных: Superset предлагает широкий выбор графиков, диаграмм и визуальных элементов, позволяя пользователям создавать красочные и информативные дашборды для анализа данных.
3. Интерактивные возможности: Пользователи могут легко взаимодействовать с дашбордами, применять фильтры, изменять параметры и проводить свертывание/развертывание данных для получения более глубокого понимания информации.
4. Интеграция с различными источниками данных: Superset поддерживает множество источников данных, включая базы данных, хранилища данных, Apache Druid и многие другие, что делает его универсальным инструментом для работы с данными из различных источников.
5. Масштабируемость и производительность: Благодаря своей архитектуре и использованию технологий, таких как Apache Druid, Superset способен эффективно обрабатывать большие объемы данных и обеспечивать высокую производительность при работе с дашбордами.
Недостатки Apache Superset:
1. Сложность настройки: Несмотря на то, что Superset предоставляет обширные возможности, его настройка и конфигурация могут быть сложными, особенно для новичков, требуя определенного уровня технической образованности.
2. Недостаточная документация: Некоторые пользователи отмечают, что документация по Superset не всегда достаточно подробна или актуальна, что может затруднить процесс изучения и работы с инструментом.
В целом, Apache Superset представляет собой мощный инструмент для визуализации данных с открытым исходным кодом, который обладает рядом преимуществ, таких как гибкость, масштабируемость и мощные визуальные возможности. Однако, перед использованием следует учитывать и недостатки, такие как сложность настройки и некоторые ограничения по ее доступности.
Apache Superset Welcome | Superset Community website for Apache Superset™, a data visualization and data exploration platform
  • 👍 1
Post #561 736
🔎Извлечение данных с Quivr
Quivr — это open-source сервис, который позволяет извлекать информацию из локальных файлов (PDF, CSV, Excel, Word, аудио, видео и т.д)
Quivr может работать в автономном режиме, поэтому всегда существует возможность получить доступ к своим данным в любое время и в любом месте.
Quivr также совместим с ОС Ubuntu 22 или новее
Открытый исходный код можно получить по данной ссылке
Quivr Quivr - Customer Support Automation Automate customer support tasks with AI-driven workflows. Up to 60% of your tasks, resolved faster.
  • 👍 1
  • 🔥 1
Post #560 752
💡📊Сервис для быстрой передачи Big Data
Redpanda — это платформа для потоковой передачи данных. Она отлично совместима с API Kafka. В 10 раз быстрее. Не требует никакого ZooKeeper и никаких JVM.
Redpanda спроектирована для полной загрузки быстрых накопителей больших данных, таких как SSD или NVMe-устройства, а также на использование преимуществ многоядерных процессоров и компьютеров с большим объемом оперативной памяти. Это позволяет достичь максимальной производительности при обработке значительных объемов данных и запросов.
Документация доступна по этой ссылке
GitHub GitHub - redpanda-data/redpanda: Redpanda is a streaming data platform for developers. Kafka API compatible. 10x faster. No ZooKeeper.… Redpanda is a streaming data platform for developers. Kafka API compatible. 10x faster. No ZooKeeper. No JVM! - redpanda-data/redpanda
  • 👍 2
  • ❤ 1
  • 🔥 1
  • 👏 1
Post #559 732
☁️💡Датасет для исследования прямого захвата воздуха
Исследователи из GeorgiaTech опубликовали крупнейший датасет и новую SOTA модель для исследования прямого захвата воздуха, это — ключевой процесс для борьбы с изменением климата
Данный набор данных содержит тестовый набор внутри домена и 4 тестовых набора вне домена (ood-large, ood-linker, ood-topology и ood-linker & topology). Все LMD-базы сжаты в один файл .tar.gz.
open-dac.github.io OpenDAC: Discovering sorbents for DAC using AI OpenDAC is a collaborative research project between FAIR at Meta and Georgia Tech, aimed at significantly reducing the cost of Direct Air Capture using AI.
Post #558 818
💡😎Отличный ресурс в коллекцию: датасеты для LLM
На многих примерах (в том числе на LLama-3 и Phi-3) можно заметить, что развитие LLM = создание качественных корпусов данных.
Разработчик из Лондона взял и описал в этом репозитории огоромное множество датасетов для предобучения или файнтюнинга LLM в формате таблицы: ссылка, размер, авторы, дата и личные пометки.
Кроме того, там есть указания, как собрать свой собственный качественный датасет, и что вообще значит слово «качественный» в контексте датасета.
GitHub GitHub - mlabonne/llm-datasets: Curated list of datasets and tools for post-training. Curated list of datasets and tools for post-training. - mlabonne/llm-datasets
  • 👍 5
Post #557 774
🌎ТОП майских ивентов в Data Science
15-16 мая - The Trends 2.0 - Москва, Россия - https://thetrends.tech/
17 мая - True Tech Day 2.0 - Москва, Россия - https://truetechday.ru/
21-22 мая - I’ML 2024 - Онлайн - https://imlconf.com/
23 мая - SUPPLY&DEMAND PLANNING CONFERENCE - Москва, Россия - https://planning-conference.ru/
24-25 мая - ANALYST DAYS / 18 - Санкт-Петербург, Россия - https://analystdays.ru/en/index
25 мая - Data Fest 2024 - Москва, Россия - https://ods.ai/events/datafest2024
31 мая - TechRec 2024. AI & HR - Москва, Россия - https://techrec.pro/techrec2024
thetrends.tech THE TRENDS — международное событие про инвестиции и технологии | Бизнес-форум в Москве 2026 10 отраслевых конференций под одной крышей. 17, 18, 19 ноября, Москва.
Post #556 725
💡Подбоорка ETL-сервисов для Big Data
Renta Marketing ETL - Облачное решение, которое позволяет интегрировать 28 корпоративных источников данных с популярными хранилищами данных вроде Snowflake и BigQuery, ервис позволяет команде инженеров и аналитиков интегрировать сторонние инструменты и за пару минут создавать конвейеры данных без кода. Например, настроить интеграцию Facebook Ads с BigQuery можно в четыре клика. Для работы в Renta Marketing ETL не нужно привлекать разработчиков.
Fivertran - Облачное ПО, которое позволяет пользователям быстро и просто создавать конвейеры. Платформа поддерживает более 90 источников. Fivertran предоставляет набор готовых интеграций, так что даже начинающие разработчики разберутся в сервисе.
Hevo Data - cервис предоставляет пользователям более 150 готовых интеграций. Настроить интеграции можно за три простых шага. В итоге получается конвейер, который копирует данные в хранилище и не требует обслуживания.
Matillion - низкокодовое приложение для создания конвейеров. С помощью Matillion команды могут создавать конвейеры и автоматизировать обработку данных. У сервиса простой интерфейс, так что создавать и изменять данные сможет пользователь, далёкий от программирования. Marillion поддерживает обработку в реальном времени. Инструмент поддерживает популярные источники данных и позволяет легко выявлять и устранять проблемы с данными.
Supermetrics - ETL-решение, предназначенное для малого бизнеса и маркетологов, которые в основном используют сервисы Facebook Ads, Google Ads и Google Analytics. В инструменте есть встроенное приложение на облачной платформе Google, которое позволяет экспортировать данные непосредственно в Google BigQuery.
renta.im ETL/ELT data pipeline platform | 100+ connectors | Renta Build fast, reliable ETL/ELT data pipelines with Renta. Connect 100+ sources to BigQuery, Snowflake, ClickHouse & more. Enterprise-grade security. Free 7-day trial.
  • 👍 2
Post #555 666
📉📊Подборочка инструментов для работы с Big Data
Drill - акладывается поверх множества источников данных, позволяя пользователям запрашивать широкий спектр информации в различных форматах, от Hadoop-файлов последовательностей и журналов сервера до баз данных NoSQL и облачных хранилищ объектов.
Druid - это аналитическая база данных реального времени, обеспечивающая низкую задержку запросов, высокий параллелизм, многопользовательские возможности и мгновенную видимость потоковых данных. По словам ее сторонников, несколько конечных пользователей могут одновременно запрашивать данные, хранящиеся в Druid, без какого-либо воздействия на производительность.
HPCC Systems — это платформа обработки больших данных, разработанная компанией LexisNexis и получившая открытый исходный код в 2011 году. В соответствии со своим полным названием — High-Performance Computing Cluster — технология по своей сути представляет собой кластер компьютеров, созданный на основе стандартного аппаратного обеспечения для обработки, управления и доставки больших данных.
Iceberg - это открытый формат таблицы, используемой для управления данными в озерах, что частично достигается путем отслеживания отдельных файлов с информацией в таблицах, а не в каталогах. Созданная компанией Netflix для использования со своими таблицами петабайтного размера, Iceberg теперь является проектом Apache. Iceberg обычно "используется в продакшне, где одна таблица может содержать десятки петабайт данных".
Kylin — это распределенное хранилище информации и аналитическая платформа для больших данных. Она предоставляет механизм аналитической обработки информации (OLAP), предназначенный для работы с очень большими массивами данных. Поскольку Kylin построена на базе других технологий Apache, включая Hadoop, Hive, Parquet и Spark, то она, по словам ее сторонников, может легко масштабироваться для обработки больших объемов данных.
Samza — это система распределенной обработки потоков, созданная компанией LinkedIn и являющаяся в настоящее время проектом с открытым исходным кодом под управлением Apache. Система может запускаться поверх Hadoop YARN или Kubernetes, также предлагается вариант автономного развертывания. Согласно информации от разработчиков, Samza может обрабатывать "несколько терабайт" информации о состоянии данных с низкой задержкой и высокой пропускной способностью для быстрого анализа.
druid.apache.org Apache Druid | Apache® Druid
  • 👍 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →