TGViewer
семантический слой семантический слой @semanticlayer · 104 subscribers
Post #6 264
На этой поговорим про еще один тренд в дата-мире, который даже отвлек VC от мониторинга AI проектов. Стартап Tinybird, который позволяет разработчикам строить real-time дата-продукты привлек $25 миллионов в Series B раунде.

Стартап строит целую платформу для решения разных задач с высокими требования к low latency обновлениям. На практике это значит, что они подключаются к какому-то стриминговому источнику типа Kafka, Kinesis / Redpanda / Pub/Sub; объединяют это все с хранилищем данных (dwh) через единый интерфейс для батчевых и стриминговых данных; кладут все это в ClickHouse и предоставляют разработчикам эндпоинты для доступа к данным. Внутри есть небольшое подобие семантического слоя для описания ключевых метрик.

Если одеть шапку сноба, то можно сказать, что это просто хорошо управляемый ClickHouse кластер, с Python оберткой вокруг него.

Если одеть маску визионера, то мы переходим в интересный мир дата-бэкенда, который напрямую соседствует с семантичкским слоем.

На диаграммах modern data stack как правило все сводится к тому, как данные надо как-то доставить в DWH, а потом из него запушить эти данные, например в BI. Однако DWH не очень подходит для real-time решений.

Например, Tinybird обычно используют для задач, где нужна персонализация на лету (например, cold start в рекомендациях) или где надо быстро реагировать на изменяющуюся природу данных, например, в беттинге или управлении инвентарем.

Из моей практики, один из самых частых случаев применения – это создание внутренний клиентской аналитики (aka embedded аналитика), которая обновляется не раз в 12 часов, а real-time.

Представьте, например, любой деволперский тул, который в админке показывает сколько вы израсходовали ресурсов или API запросов в режиме реального времени.

Тут возникает такое понятие, как «дата-бэкенд» (не сказать, что люблю его, но вендоры часто используют). За основу берутся таблицы и бизнес-логика из dwh, но отличны схемы интеграции, low-latency querying, tenant-isolated access control и отдельный пайплан для обработки стриминга.

Подход Tinybird это платформенный метод решения задачи, но есть и другие вендоры, кто решает глобальную задачу, но на разных участках value chain. Например, можно посмотреть на тот же Cube, Patch, Propel, Hasura.

Наверное, может возникнуть вопрос, что все это как-то не гармонично выглядит — и DWH держать и еще Clickhouse где-то рядом. Например, Databricks с вами полностью согласен, который намекает на то, что дата-платформу и бэкенд можно связать единый унифицированным хранилищем. Но про это поговорим в другом посте.
TechCrunch Tinybird raises another $30 million to transform data into real-time APIs Tinybird is not so tiny anymore. The enterprise data startup TechCrunch first covered three years ago has been growing at a rapid pace and recently raised
More from @semanticlayer
  1. Nov 13, 2025​​Семантический слой Когда-то, работая аналитиками, мы делали сотни дашбордов. Заказчики и…
  2. Oct 14, 2025Что, на самом деле происходит в слиянии Fivetran и dbt Думаю, все уже слышали о самом свеж…
  3. Sep 29, 2025кажется наблюдаем закат движения modern data stack https://www.theinformation.com/articles…
  4. Aug 26, 2025прочитал слегка старую (от июня), но годную заметку от General Analysis про уязвимости в с…
  5. Aug 22, 2025photo post
  6. Jun 25, 2025результаты. использовали Llama-3.1-8BInstruct и сравнивали с другими text-to-sql подходами…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →