🤖 RisingWave 3.0: взгляд на AI-инфраструктуру со стороны данных
Последние пару лет вокруг AI много говорят про модели, RAG и векторные базы.
Но когда компании начинают запускать AI-агентов в продакшене, быстро выясняется, что одна из главных проблем находится совсем в другой плоскости — как дать модели доступ к актуальным данным.
Представьте агента поддержки клиентов.
Он сообщает, что товар есть в наличии, хотя его уже раскупили.
Показывает старый статус заказа или предлагает промокод, который больше не действует. Во многих случаях причина таких ошибок довольно простая: модель получает устаревшую информацию.
Именно на эту проблему нацелена новая версия RisingWave.
Вместо того чтобы при каждом запросе собирать данные из множества систем, платформа предлагает заранее формировать актуальное состояние бизнеса в виде непрерывно обновляемых materialized views.
Изменения поступают через CDC из PostgreSQL, MySQL, Kafka и других источников, обрабатываются потоковым SQL и становятся доступны через привычный PostgreSQL-интерфейс или MCP.
В RisingWave предлагают смотреть на data lake не просто как на место хранения данных.
Для аналитики это хранилище таблиц и исторических данных.
Для AI-приложений — место, где хранится весь накопленный контекст, который может понадобиться модели.
Поэтому в версии 3.0 поддержка Apache Iceberg превратилась из обычного sink'а в полноценный табличный движок.
Появилась поддержка Iceberg V2 и V3, автоматическая эволюция схем, встроенная компакция файлов, очистка старых снапшотов и собственный query engine на базе Apache DataFusion.
При этом данные остаются в открытом формате.
Один и тот же Iceberg-слой может использоваться RisingWave, Spark, Trino, DuckDB и любыми другими совместимыми инструментами.
Получается интересная картина: потоковые данные обновляют представления практически в реальном времени, аналитика работает поверх тех же данных, а AI-приложения получают доступ к актуальному контексту из того же самого хранилища.
Без отдельных копий данных и без привязки к одному вендору.
Мне кажется, это одна из самых интересных идей в релизе. Не очередная попытка построить новую AI-платформу, а попытка решить вполне практическую задачу: как поддерживать данные в таком состоянии, чтобы ими одновременно могли пользоваться и аналитические системы, и AI-приложения.
@tldr_data
Post #120
173