Ситуация была такая: есть большой parquet-файл, из которого нужно достать конкретную информацию. Полностью скачивать его к себе не хочется: долго, тяжело, да и часто это просто лишнее.
И тут отлично заходит DuckDB.
DuckDB позволяет обращаться к parquet-файлам практически как к обычной SQL-таблице. То есть можно написать SQL-запрос и вытащить только нужные данные, не разворачивая вокруг этого отдельную инфраструктуру.
Примерно так:
SELECT * FROM read_parquet('s3://bucket/path/file.parquet')
WHERE event_date >= '2026-01-01'
LIMIT 100;
Что понравилось:
• не нужно грузить весь файл локально
• можно быстро проверить гипотезу через SQL
• parquet читается нативно
• удобно для ad-hoc аналитики и разовых выгрузок
По ощущениям, DuckDB это такой маленький, но очень мощный инструмент, который закрывает огромный пласт задач между "давайте просто посмотрим файл" и "давайте поднимем полноценный data pipeline".
Особенно полезно, когда нужно быстро:
• посмотреть структуру данных
• отфильтровать нужные строки
• сделать агрегацию
• выгрузить небольшой срез
• проверить качество данных
Кому актуально дока тут.
Сегодня DuckDB сделал мой день 🪿