1. Чем DataForge отличается от витрин с описанием?
DataForge – это не статическое описание витрин, а исполняемый семантический слой, который управляет логикой расчётов. При изменении формул в DataForge витрины автоматически обновляются и становятся доступными во всех подключённых BI-системах.
2. Чем DataForge отличается от дата-каталога?
Дата-каталог, как класс продуктов, предназначен в первую очередь для документирования и описания всех существующих данных, не влияя на их преобразования.
DataForge же фокусируется на создании и управлении семантическим слоем для аналитических данных в связке с формированием витрин в хранилищах, обеспечивая использование единой логики расчётов во всех аналитических системах.
3. С каким технологическим стеком есть интеграции кроме PostgreSQL и ClickHouse? Поддерживаются ли S3 или Trino?
На текущий момент DataForge поддерживает PostgreSQL, Microsoft SQL Server и ClickHouse. При этом продукт ориентирован на взаимодействие с хранилищами данных через SQL-запросы. Это позволяет в дальнейшем расширять поддержку различных реляционных СУБД, аналитических хранилищ и SQL-движков, включая Trino.
Кроме того, мы учитываем растущую популярность архитектур Lakehouse и формата Apache Iceberg и планируем соответствующие интеграции. Они, в том числе, позволят работать с данными, размещёнными в объектных и файловых хранилищах, таких как S3.
4. Что в понятиях DataForge подразумевается под "Сверкой расчётов"? Есть ли проверка распределений на нормальность, мультимодальность, мультиколлинеарность? Возможно ли построение квантильных графиков?
DataForge не предназначен для выполнения статистического анализа и не реализует проверки распределений, корреляций или построение статистических графиков. Его основная задача – управление семантическим слоем и формирование витрин данных.
При этом в рамках «сверки расчётов» пользователи могут непосредственно в продукте вычислять значения показателей по заданным формулам на фактических данных источника, моделировать различные сценарии и сравнивать полученные результаты с внешними эталонными отчётами. Это позволяет проверить корректность формул и бизнес-логики до использования витрин в BI-инструментах.
5. Возможно ли использование DataForge для проведения A/B-тестов, факторного анализа и статистического моделирования?
Нет, DataForge не предоставляет инструментов для статистического моделирования. Это платформа для централизованного управления семантическим слоем и построения витрин.
6. Есть ли в DataForge возможность построить дерево метрик?
Да, DataForge автоматически строит дерево зависимостей (происхождение) для показателей (метрик), помогая понять, как одни показатели вычисляются на основе других.
7. Можно ли сказать, что DataForge похож на решение Oracle BI в части построения модели?
Да, на более общем уровне в DataForge используются те же самые внутренние слои у моделей:
- Физический слой фактического хранилища данных, с которым пользователи напрямую не работают
- Логический слой описанных пользователями моделей данных, которые связываются с необходимыми полями и таблицами из физического слоя
- Слой представления, описывающий понятные пользователям бизнес-сущности, созданные на основе элементов из логического слоя.
Однако в деталях реализации, естественно, возможны значительные различия.
8. Как был подключен к данным показанный в демо дашборд в FineBI?
Основным источником данных, где создавались витрины для демонстрационных дашбордов как в FineBI, так и в других BI системах, был ClickHouse. При этом в FineBI было настроено Direct подключение к необходимой витрине, а Excel и Power BI загружали эти данные в свои внутренние модели. Подключение к PostgreSQL использовалось только в рамках сценария миграции, где дашборд в Power BI переключался с витрины в PostgreSQL на созданную копию этой витрины в ClickHouse.