در مورد ادمین کانال :
- محمد عالیشاهی
- دکترای هوش مصنوعی دانشگاه تهران
- مدیر ارشد پروژه های هوش مصنوعی و علم داده
-دبیر شورای حکمرانی داده انجمن هوش مصنوعی ایران
Post #1313
663
مهندسی و علم داده چطور ClickHouse روی 100 میلیون رکورد Query اجرا میکند، بدون اینکه 100 میلیون رکورد را بخواند؟ وقتی صحبت از Performance در سیستمهای تحلیلی میشود، معمولاً ذهنمان میرود سمت: • CPU • RAM • سرعت Disk اما در ClickHouse یک سؤال مهمتر وجود دارد: چقدر از داده…
نکته مهم همینجاست:
100M Records ≠ 100M Records Read
به همین دلیل:
• Partitioning
• ORDER BY
• Data Layout
در ClickHouse فقط تصمیمهای مربوط به Storage نیستند؛ مستقیماً روی Performance Query اثر میگذارند.
پس وقتی یک Query کند است، قبل از اینکه سراغ CPU و RAM برویم، بهتر است یک سؤال ساده بپرسیم:
«چرا این همه داده دارد خوانده میشود؟»
در بسیاری از سیستمهای تحلیلی، سریعتر شدن Query از پردازش بیشتر شروع نمیشود؛ از خواندن کمتر داده شروع میشود.
Less Data Read → Less I/O → Less CPU Work → Faster Query
@BIMining
100M Records ≠ 100M Records Read
به همین دلیل:
• Partitioning
• ORDER BY
• Data Layout
در ClickHouse فقط تصمیمهای مربوط به Storage نیستند؛ مستقیماً روی Performance Query اثر میگذارند.
پس وقتی یک Query کند است، قبل از اینکه سراغ CPU و RAM برویم، بهتر است یک سؤال ساده بپرسیم:
«چرا این همه داده دارد خوانده میشود؟»
در بسیاری از سیستمهای تحلیلی، سریعتر شدن Query از پردازش بیشتر شروع نمیشود؛ از خواندن کمتر داده شروع میشود.
Less Data Read → Less I/O → Less CPU Work → Faster Query
@BIMining
- ❤ 10
- 👍 5
- 👏 2
- 🔥 1


















