👀 Где взять динамический датасет для целей тестирования?
Большая часть датасетов и sample databases являются статичными, т.е. представляют из себя снимок. Эти данные не меняются со временем.
Мы привыкли изучать такие данные, проводить Exploratory Data Analysis, строить дашборды, обучать ML-модели. Удобно пользоваться Sample Tutorials от вендоров и тулов. Awesome Public Datasets, Kaggle, Metabase Sample Database, и даже AdventureWorks - это всё примеры статики.
Но ряд задач можно изучать и решать только на динамическом датасете, т.е. тех данных, с которыми происходят мутации в режиме реального времени - INSERT, UPDATE, DELETE:
— Online data replication (Change Data Capture)
— Streaming tasks: Analytics, ML, Inference
— Testing configurations: Database, Queues, Services, Monitoring tools
У меня есть желание иметь песочницу с СУБД с постоянно идущими осмысленными транзакциями. В идеале это осмысленный OLTP с постоянно идущими операциями CRUD.
Вот то, что я нашел на текущий момент:
— Samples of Docker Compose applications with multiple integrated services. Много всего, сложно найти что-то релевантное и подходящее.
— Online Boutique (GCP): Sample cloud-first application with 10 microservices showcasing Kubernetes, Istio, and gRPC. Это уже более конкретно и похоже на то, что нужно. Но это GCP, слишком большое количество сервисов для моей задачи.
— Взять любую СУБД с датасетом и написать к ней SQL-запросы. Запросы запускать по расписанию. Однако это дополнительные траты времени и усилий (изучи структуру, напиши запросы, шаблонизируй, запускай)
— Использовать для запуска запросов тулы для нагрузочного тестирования: locust.io, Jmeter
— RSS feed -> PostgreSQL (INSERTs only), но это простенько, уже СУБД + сервис для чтения RSS (на Python, например)
💬 Подскажите мне свои идеи, как можно быстро и просто (например, в контейнере) получить пример динамического датасета (например, в СУБД Postgres / MySQL / MSSQL)?
🌐 @data_apps | Навигация по каналу
Post #347
1.33K