TGViewer
Channel Public Channel
Школа Больших Данных

Школа Больших Данных

@bigdataschool_ru

Канал Школы Больших Данных https://www.bigdataschool.ru/ - обучение технологиям Big Data: разработка приложений и администрирование кластеров Hadoop, Kafka, Spark, NoSQL, Python, ML и DS.
Тел: +7 (495) 41-41-121
Контакты: @Bigdataschool_msk @olga_burykh
Subscribers
657
Photos
363
Videos
0
Links
970
Recent Posts 20 shown
Post #1314 61
PostgreSQL 19: планы запросов стали стабильнее

Нестабильные планы запросов — одна из главных причин скачков производительности в PostgreSQL. Изменение статистики или обновление версии может внезапно замедлить запросы. В новой версии появилось расширение pg_plan_advice, которое позволяет зафиксировать планы и избежать таких проблем.

Что нового в PostgreSQL 19

• расширение pg_plan_advice для фиксации планов запросов
• улучшения в планировщике для NOT IN и внешних соединений
• отмена ряда фич: слияние секций, GROUP BY ALL, SQL/PGQ и других
• JIT-компиляция теперь отключена по умолчанию

Теперь можно защитить производительность критически важных запросов от изменений статистики, но часть ожидаемых возможностей придётся реализовывать другими способами.

Читать статью

#PostgreSQL #DBA #QueryOptimization #SQL #DataEngineering
Post #1313 81
Как упростить доступ к данным в S3 и отказаться от прокси?

Вместо сложных внешних прокси-серверов теперь можно использовать политики бакетов, которые хранятся прямо в хранилище. Это снижает задержки, уменьшает количество точек отказа и упрощает управление доступом. Bucket Access Policy — это JSON-документ, который описывает права на уровне всего бакета и проверяется самим хранилищем.

Что делаем на практике

• переносим правила доступа из прокси в политику бакета
• проверяем приоритеты: политика бакета, ACL и политика ключа
• тестируем матрицу из 16 комбинаций для разных сценариев доступа
• адаптируем политики из AWS для VK Cloud
• выгружаем артефакты для аудита и регуляторов

Централизованный контроль без лишних компонентов — это новый стандарт для безопасности и производительности.

Читать статью

#S3 #BucketAccessPolicy #DataSecurity #CloudStorage #DevOps
Post #1312 106
Почему Kafka теряет порядок событий и как это исправить

Transactional outbox — популярный шаблон для согласованной отправки событий в Kafka, но он имеет скрытые проблемы с порядком следования событий. Это может привести к серьёзным ошибкам, например когда статус «Оплачен» приходит после «Упакован».

Где именно ломается порядок

• Вставка в outbox-таблицу: одновременные транзакции нарушают порядок
• Отправка в Kafka: retries и асинхронность делают порядок непредсказуемым
• Обработка потребителем: параллельные потоки могут применять события не по порядку
• Перезапуски: события теряются из-за особенностей работы offset'ов
• Российские проекты: типичные настройки усиливают эти проблемы

Если строгий порядок критичен — используйте дополнительные механизмы контроля или альтернативные шаблоны.

Читать статью

#Kafka #Outbox #DataConsistency #EventDriven #DataEngineering
Post #1311 122
Выбор каталога для Iceberg на своём железе

Lakekeeper и Apache Polaris решают одну и ту же задачу: хранят указатели на актуальные версии таблиц Iceberg, выполняют коммиты и проверяют права доступа. Без надёжного каталога даже правильно записанные parquet-файлы быстро теряют целостность при параллельной работе Spark, Trino...

https://bigdataschool.ru/blog/events/lakekeeper-apache-polaris-rest-iceberg/
Post #1310 137
Как PostgreSQL перестал упираться в потолок производительности

Классический PostgreSQL упирается в ограничения одного сервера, а шардирование и репликация добавляют сложностей. Tantor Polar решает эту проблему, разделяя вычисления и хранение, сохраняя при этом полную совместимость с PostgreSQL.

Что даёт новая архитектура

• Shared-storage модель с доступом через RDMA
• Мгновенное добавление реплик без копирования данных
• Латентность репликации в миллисекундах
• Поддержка 100% совместимости с приложениями PostgreSQL
• Производительность до 2,6 млн транзакций в минуту

Сегодня можно строить мощные системы на PostgreSQL без головной боли с шардированием.

Читать статью

#PostgreSQL #TantorPolar #Database #HighLoad #RDMA
  • ❤ 1
Post #1309 123
Trino для SQL-запросов к Iceberg в S3: проще, быстрее, дешевле

Аналитика данных часто требует копирования информации из одного хранилища в другое, что приводит к лишним затратам и проблемам синхронизации. Trino решает эту задачу, позволяя работать с данными напрямую через SQL, без переноса и запуска тяжёлых кластеров. Это упрощает федеративные запросы и снижает затраты на инфраструктуру.

Почему Trino?

• прямой доступ к данным Iceberg в S3 через SQL
• упрощение федеративных запросов без копирования
• поддержка Time Travel и эволюции схемы
• адаптивное выполнение запросов и динамическая фильтрация
• масштабируемость и изоляция нагрузки через Resource Groups

Trino отделяет вычисления от хранения, что делает работу с данными быстрее и дешевле.

Читать статью

#Trino #Iceberg #S3 #DataLake #SQL
Post #1308 131
ClickHouse 26.9: как новые фичи экономят память и ускоряют аналитику

Новый релиз ClickHouse принёс важные оптимизации для работы с большими данными. Главные улучшения — спиллинг на диск, условный LIMIT и инкрементальные представления. Это снижает нагрузку на память и ускоряет ежедневную аналитику.

Что нового в релизе

• Условный LIMIT останавливает запрос при выполнении условия
• Инкрементальное обновление append-only materialized views
• Спиллинг DISTINCT на диск при нехватке памяти
• Ускорение простых агрегатов (min, max, count)
• Токены доступа с ограниченным сроком действия

Обновление особенно полезно для кластеров со средним объёмом памяти, где раньше были проблемы с OOM.

Читать статью

#ClickHouse #DWH #DataEngineering #OLAP #Performance
Post #1307 124
Polaris — новый стандарт для Iceberg в Apache

Создание надежного lakehouse требует не только выбора формата файлов, но и управления метаданными. Polaris стал каталогом для Iceberg, обеспечивая целостность и безопасность данных в распределенных системах. Это особенно важно при работе с большими объемами информации и множеством пользователей.

Что делает Polaris

• управляет метаданными через реляционную базу данных
• обеспечивает атомарность обновлений и безопасность
• снижает риск расхождения метаданных между командами
• упрощает доступ к данным через единый сервис прав
• поддерживает интеграцию с S3 и PostgreSQL

Polaris — это шаг к открытой и масштабируемой архитектуре данных.

Читать статью

#Polaris #Iceberg #Lakehouse #DataEngineering #Apache
  • 👍 1
Post #1306 127
Как AstraZeneca разделила хранилища данных и избежала компромиссов

Когда бизнес требует одновременно точных отчётов, быстрых экспериментов и долгосрочного архивирования, единая система данных может стать узким местом. AstraZeneca нашла решение, разделив платформу на специализированные компоненты для каждой задачи.

Как это работает на практике

• BI-слой: строгая валидация данных для регламентированной отчётности.
• DWH: гибкая аналитика с контролем качества и трассируемой историей.
• Data Lake: сырые данные для экспериментов и гипотез.
• Централизованный каталог метаданных и lineage для интеграции.
• Процессы сертификации данных для снижения ошибок.

Такое разделение позволяет распределить нагрузку и избежать конфликтов, но требует дополнительных усилий по поддержке и синхронизации.

Читать статью

#DataLake #DWH #BI #DataArchitecture #AstraZeneca
  • ❤ 1
  • 👍 1
Post #1305 134
Переносим Parquet в MySQL без лишних скриптов — через ClickHouse

Миграция данных между разными форматами обычно требует написания промежуточного ETL-кода. Но теперь ClickHouse позволяет загружать данные напрямую из Parquet в MySQL, экономя время инженеров.

Как это работает

• используем table functions для чтения Parquet и записи в MySQL
• настраиваем подключение через named collections
• преобразуем типы данных на лету
• обрабатываем большие объёмы без промежуточных файлов
• тестируем производительность: 2.3 млн строк за 16 секунд

ClickHouse становится удобным посредником, сокращая количество шагов в пайплайне.

Читать статью

#ClickHouse #MySQL #ETL #DataMigration #Parquet
  • 👍 1
Post #1304 268
ClickHouse научился разделять вычисления и хранение

Классический ClickHouse требует масштабировать CPU, память и диски пропорционально — это дорого и неэффективно для больших кластеров. Новая функция CAS (Content Addressed Storage) позволяет хранить данные в общем объектном хранилище и масштабировать только вычислительные узлы.

Как это работает на практике

• CAS адресует данные по хешу содержимого, а не по пути
• Узлы работают с одной копией без дублирования
• Достаточно обновить ClickHouse до версии Antalya 26.6
• Поддерживает все движки семейства MergeTree
• Совместим с on-premise хранилищами (Ceph, MinIO)

Экономия на железе без перестройки архитектуры — главный плюс для российских on-premise кластеров.

Читать статью

#ClickHouse #CAS #DataEngineering #DWH #MergeTree
  • 👍 1
Post #1303 213
Keeper vs ZooKeeper: как ClickHouse избавился от Java

ClickHouse всегда нуждался в строгой координации для репликации и распределённых DDL. ZooKeeper справлялся с этой задачей, но требовал отдельного Java-процесса, что усложняло эксплуатацию. Keeper, реализованный на C++ с использованием Raft, позволил убрать JVM из стека, сохранив совместимость с ZooKeeper API.

Как развивался Keeper

• повтор ZooKeeper API поверх Raft без изменений в логике ClickHouse
• оптимизация производительности: batched apply, улучшенный snapshot, работа с диском
• ClickHouse-специфичные улучшения: tighter интеграция с метриками, упрощённая настройка
• однопроцессная модель C++ без сборки мусора и с предсказуемым потреблением памяти

Keeper не просто заменил ZooKeeper — он упростил эксплуатацию и снизил операционные издержки.

Читать статью

#ClickHouse #Keeper #ZooKeeper #DataEngineering #DWH
  • ❤ 1
  • 👍 1
Post #1302 193
Пайплайны SQL в ClickHouse: упрощаем сложное

Работа с большими данными часто требует написания сложных SQL-запросов. Вложенные подзапросы и CTE делают код громоздким и сложным для понимания. ClickHouse 26.8 предлагает новый подход - пайплайны SQL.

Что нового и как это использовать

• Оператор |> позволяет писать запросы как последовательность преобразований
• Упрощается процесс отладки сложных аналитических запросов
• Пайплайны повышают читаемость кода и упрощают передачу знаний новичкам
• Оптимизатор ClickHouse строит единый план выполнения без лишних сканирований
• EXTEND добавляет расчётные поля, сохраняя существующие колонки

Новый синтаксис делает работу с данными более интуитивной и снижает вероятность ошибок.

Читать статью

#ClickHouse #SQL #DataEngineering #DWH #BigData
  • 👍 1
Post #1301 195
Как перейти на Iceberg и сохранить данные в ClickHouse

Масштабные миграции ETL-процессов на новый стек могут казаться сложными, но платформа o_rabbit упрощает этот переход. Она позволяет экспортировать данные в Parquet-файлы на S3, регистрировать их как таблицы Iceberg и обеспечивать доступ через Project Antalya. Это подходит командам, готовым перестроить процессы под открытый data lake и отказаться от привычных вставок в ClickHouse.

Что делает o_rabbit

• экспортирует данные в Parquet-файлы на S3
• регистрирует таблицы Iceberg для управления снимками и изменениями
• обеспечивает доступ к данным через Project Antalya
• делит задачи на мастера и исполнителей для отказоустойчивости
• использует SQLite для управления состоянием и восстановления после сбоев

Главное преимущество — масштабируемость и устойчивость к сбоям даже при больших объемах данных.

Читать статью

#Iceberg #ETL #ClickHouse #DataLake #ProjectAntalya
  • 👍 1
Post #1300 176
Быстрый импорт в Postgres без лишних копирований

Загрузка данных из облачных хранилищ в Postgres часто становится узким местом из-за конвертаций форматов и промежуточных этапов. Расширение chdb встраивает движок ClickHouse в Postgres, ускоряя импорт в 2-3 раза.

Что умеет chdb

• работает с S3, GCS и Azure Blob Storage
• поддерживает Parquet, Avro, ORC и другие форматы
• автоматически подхватывает новые форматы из ClickHouse
• позволяет загружать данные одной командой COPY
• обеспечивает стабильное время импорта независимо от формата

Интеграция ClickHouse в Postgres открывает новые возможности для работы с облачными данными.

Читать статью

#Postgres #ClickHouse #DataImport #ETL #CloudStorage
  • 👍 1
Post #1299 166
Мониторинг PostgreSQL 19 - что изменится на практике

PostgreSQL 19 приближается к выходу и добавляет несколько точечных, но ощутимых улучшений в observability. Основные правки касаются видимости блокировок, гибкости логирования по типам процессов, разделения настроек для VACUUM и ANALYZE, а также учета реального объема полностранич...

https://bigdataschool.ru/blog/events/postgres-19-monitoring-whats-new/
  • 👍 1
Post #1298 180
Как передать данные из Postgres в ClickHouse с минимальной задержкой?

Когда нужна оперативная аналитика на данных из транзакционной базы, традиционные методы репликации могут вызывать задержки в несколько секунд. WalShadow предлагает альтернативу — чтение физического WAL журнала Postgres и передача данных прямо в ClickHouse с задержкой всего 200 мс.

Как это работает

• Чтение и декодирование WAL вне источника для снижения нагрузки
• Параллельная обработка данных для высокой пропускной способности
• Сохранение типов данных без конвертации в промежуточные форматы
• Использование барьеров для обеспечения согласованности при DDL

Инструмент позволяет получать аналитику практически в реальном времени, минимизируя влияние на продуктивный Postgres.

Читать статью

#Postgres #ClickHouse #DataReplication #WAL #Analytics
  • 👍 1
Post #1297 163
Flink Kubernetes Operator 1.16.0 — теперь автоскейлинг под вашим контролем

Новый релиз оператора для Apache Flink приносит долгожданные улучшения в автоскейлинг и документацию. Теперь можно точнее настраивать масштабирование под задачи без переписывания кода самого оператора.

Что нового в 1.16.0

• Полностью переработанная документация — быстрее находим нужные настройки
• Новый режим BALANCED для выравнивания параллелизма — меньше избыточных ресурсов
• Три SPI для кастомизации автоскейлера — подключаем свои правила без форков
• Нативные ресурсы Kubernetes — проще интегрировать с существующей инфраструктурой
• Улучшения безопасности и надёжности savepoints — меньше рисков в продакшене

1.16.0 делает работу с Flink в Kubernetes более предсказуемой и гибкой.

Читать статью

#Flink #Kubernetes #Autoscaling #DataEngineering #StreamProcessing
  • 👍 2
  • 🔥 2
Post #1296 167
ClickHouse теперь понимает PromQL — храним метрики вместе с логами

ClickHouse представил новый движок TimeSeries с поддержкой PromQL — языка запросов Prometheus. Это позволяет хранить метрики в ClickHouse без перевода запросов на SQL и сохранить всю семантику Prometheus.

Что это даёт на практике

• Отправляем метрики в ClickHouse через remote write без изменения конфигурации Prometheus
• Запрашиваем данные на привычном PromQL — никакого переучивания
• Коррелируем метрики с логами в одной системе для быстрого расследования инцидентов
• Экономим на инфраструктуре, сокращая число хранилищ
• Используем существующие дашборды Grafana без изменений

Один ClickHouse для логов и метрик — меньше переключений и проще анализ.

Читать статью

#ClickHouse #Prometheus #TimeSeries #Monitoring #DataEngineering
  • 👍 2
Post #1295 187
ClickHouse 26.8 - что важно для инженеров в РФ

Вышел ClickHouse 26.8 LTS. Релиз содержит почти сотню новых функций, более сотни оптимизаций производительности и свыше пятисот исправлений. Среди заметных изменений - запуск запросов в фоне, поддержка регулярных выражений в стиле PostgreSQL, новые токенизаторы для текстового пои...

https://bigdataschool.ru/blog/events/clickhouse-release-26-08/
  • 👍 4
  • ❤ 1
  • 🔥 1
Older posts →

About this channel

How can I read @bigdataschool_ru without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Школа Больших Данных: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Школа Больших Данных have?
Школа Больших Данных (@bigdataschool_ru) has 657 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Школа Больших Данных know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →