💥YTsaurus: система для хранения и обработки Big Data Яндекса стала open-source
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
Post #403
941
- 👍 2
- 🔥 1