TGViewer
tl;dr data tl;dr data @tldr_data · 153 subscribers
Post #120 173
🤖 RisingWave 3.0: взгляд на AI-инфраструктуру со стороны данных

Последние пару лет вокруг AI много говорят про модели, RAG и векторные базы.
Но когда компании начинают запускать AI-агентов в продакшене, быстро выясняется, что одна из главных проблем находится совсем в другой плоскости — как дать модели доступ к актуальным данным.

Представьте агента поддержки клиентов.
Он сообщает, что товар есть в наличии, хотя его уже раскупили.
Показывает старый статус заказа или предлагает промокод, который больше не действует. Во многих случаях причина таких ошибок довольно простая: модель получает устаревшую информацию.

Именно на эту проблему нацелена новая версия RisingWave.
Вместо того чтобы при каждом запросе собирать данные из множества систем, платформа предлагает заранее формировать актуальное состояние бизнеса в виде непрерывно обновляемых materialized views.

Изменения поступают через CDC из PostgreSQL, MySQL, Kafka и других источников, обрабатываются потоковым SQL и становятся доступны через привычный PostgreSQL-интерфейс или MCP.

В RisingWave предлагают смотреть на data lake не просто как на место хранения данных.
Для аналитики это хранилище таблиц и исторических данных.
Для AI-приложений — место, где хранится весь накопленный контекст, который может понадобиться модели.

Поэтому в версии 3.0 поддержка Apache Iceberg превратилась из обычного sink'а в полноценный табличный движок.
Появилась поддержка Iceberg V2 и V3, автоматическая эволюция схем, встроенная компакция файлов, очистка старых снапшотов и собственный query engine на базе Apache DataFusion.

При этом данные остаются в открытом формате.
Один и тот же Iceberg-слой может использоваться RisingWave, Spark, Trino, DuckDB и любыми другими совместимыми инструментами.

Получается интересная картина: потоковые данные обновляют представления практически в реальном времени, аналитика работает поверх тех же данных, а AI-приложения получают доступ к актуальному контексту из того же самого хранилища.
Без отдельных копий данных и без привязки к одному вендору.

Мне кажется, это одна из самых интересных идей в релизе. Не очередная попытка построить новую AI-платформу, а попытка решить вполне практическую задачу: как поддерживать данные в таком состоянии, чтобы ими одновременно могли пользоваться и аналитические системы, и AI-приложения.

@tldr_data
RisingWave RisingWave 3.0: The real-time context layer for interactive AI Discover RisingWave 3.0, featuring Apache Iceberg V3, native vector search, DataFusion, SQL operational workflows, and a real-time context layer for AI.
  • ❤ 1
More from @tldr_data
  1. Sep 18, 2026SLayer Спросите агента о выручке дважды — и он дважды напишет два никак не связанных между…
  2. Sep 13, 2026OpenAI запустила Data agent в ChatGPT Work — агента для работы с корпоративными данными. О…
  3. Sep 12, 2026LLMSQLQueryOperator В Airflow появился новый декоратор task.llm_sql, который генерирует SQ…
  4. Sep 11, 2026walshadow walshadow реплицирует данные из PostgreSQL в ClickHouse из физического WAL, вклю…
  5. Sep 9, 2026HydraDB - fast graph database on object storage HydraDB превращает графовую базу данных в…
  6. Sep 8, 2026Make analytics context usable by agents ktx — open-source context layer for data agents, к…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →