How to. Make MultiSources SQL with Trino
Потестировал тут намедни Trino в DataLens, хочу тут пока зафиксировать, что получилось, что нет и зачем оно вообще в BI?
💚
- Можно делать датасеты в BI с табличками из разных источников и оно работает!
- При этом, для улучшения производительности, берутся статистики по таблицам и если возможно и нужно, результат из одного источника пуш даунится в другой и вообще или дропается JOIN и заменяется на WHERE IN или передается как CTEшка
- Хорошо масштабируется
- Очень крутой Explain, если его лениво самому читать - теперь ж есть AI, когда в первый раз не понял, куда Трина пошла - попросил распарсить всё Алису - подтвердила гипотезу правильной работы с фильтрами. После КХ тут конечно очень вкусный Explain =)
- Есть кеширование запросов в БД, то есть, если у вас слева табличка и по ней ничего не меняется никогда - Трино прочитает раз ее и будет какое-то время брать из кэша ее
- Можно легко попробовать развернуть в Докере
- очень быстро добавлять каталоги (подключения) - в целом за 6 часов проверил все гипотезы с нуля, когда вообще не трогал зверя
💔
- Вроде можно делать кросс-датасетные вещи, но самая база-база: твоя БД + csv[excel] на S3 - нет такого. то есть в любом случае эксельки надо во что-то другое положить или hive/ch как прослойку ну такое
- Какой-то сюр с добавлением пользователей, через downtime системы. Это прям странное для меня в 2025, настроечный файл + ребут
- Для больших JOIN не сможет перекинуть весь контекст в соседнюю систему, то есть JOIN по номеру заказа (например, база с продажами и логистическая) - без фильтрации предварительной не сможет, иногда может стать блокером
- Не бесплатное, если поиграться в облаке, то есть не по цене чашки кофе, как КХ =)
Post #127
1.54K

- 🔥 2
- 🤯 2
- 🙏 1