چند وقتیه دارم روی زیرساختهای AI و سرورهای GPU بیشتر کار میکنم و یکی از کانفیگهایی که توجهم رو جلب کرد، سروری با ۴ عدد A100 80GB بود.
اولین چیزی که به چشم میاد، ۳۲۰ گیگابایت حافظه GPU هست؛ یعنی ۴ تا A100 که هر کدوم ۸۰ گیگ VRAM دارن.
البته اینجا یک نکته مهم وجود داره: این ۳۲۰ گیگابایت مثل یک حافظه یکپارچه ۳۲۰ گیگابایتی نیست. هر GPU حافظه خودش رو داره و برای مدلهای بزرگ باید از تکنیکهای Multi-GPU و تقسیم مدل استفاده کرد. ولی اگر نرمافزار و معماری درست تنظیم بشه، همین موضوع برای اجرای مدلهای بزرگ خیلی کاربردیه.
مثلاً برای LLMهایی در محدوده 70B، این سیستم واقعاً گزینه جذابیه. مدلهایی مثل Llama 70B یا مدلهای مشابه رو میشه با تنظیمات مناسب اجرا کرد و اگر از Quantization استفاده کنیم، دستمون برای مدلهای بزرگتر هم بازتر میشه.
یکی از کاربردهایی که به نظرم این سیستم برایش خیلی مناسبه، راهاندازی یک LLM خصوصی برای شرکتهاست.
فرض کنید یک شرکت حجم زیادی سند، قرارداد، گزارش، اطلاعات فنی و دانش داخلی داره. میشه روی همین زیرساخت یک مدل زبانی، RAG، Vector Database و سیستم جستوجو راهاندازی کرد تا کارمندان بتونن با اطلاعات داخلی شرکت به شکل طبیعی صحبت کنن.
از طرف دیگه، برای Fine-tuning هم ظرفیت خوبی داریم. مدلهای 7B، 13B و 32B با روشهایی مثل LoRA و QLoRA کاملاً در محدوده منطقی این سیستم هستن و برای مدلهای بزرگتر مثل 70B هم میشه با روشهای بهینهسازی سراغ Fine-tuning رفت.
چیزی که برای من جالبه اینه که این سرور فقط برای LLM نیست.
برای Computer Vision، OCR، تشخیص اشیا، پردازش ویدئو، Speech-to-Text، تولید تصویر و حتی محاسبات علمی مبتنی بر CUDA هم میشه ازش استفاده کرد.
از نظر سختافزار هم ترکیب جالبیه:
۲ عدد Xeon Platinum 8468
۱ ترابایت RAM DDR5
۴ عدد A100 80GB
و حدود ۳۲ ترابایت NVMe
یعنی از سمت CPU، RAM، GPU و Storage تقریباً برای Datasetهای بزرگ و پروژههای جدی AI چیزی کم نداریم.
از نظر قدرت GPU هم اگر فقط عدد تئوری رو نگاه کنیم، هر A100 حدود 312 TFLOPS توان Tensor در FP16 داره. بنابراین چهار GPU روی هم حدود 1.25 PFLOPS توان FP16 Tensor ارائه میدن.
البته من هیچوقت فقط با این عددها قضاوت نمیکنم. در دنیای واقعی، سرعت اجرای مدل به خیلی چیزها بستگی داره؛ از نوع مدل و Quantization گرفته تا Batch Size، ارتباط بین GPUها، حافظه و بهینهسازی نرمافزار.
یک نکته دیگه هم هست که به نظرم باید قبل از خرید چنین سیستمی جدی گرفته بشه: برق و خنکسازی.
چهار A100 خودشون حدود ۱۲۰۰ وات توان اسمی میخوان و دو CPU هم هرکدوم TDP حدود ۳۵۰ وات دارن. بنابراین با سیستمی طرفیم که وقتی واقعاً زیر بار بره، مصرف برق و حرارتش اصلاً شوخی نیست.
در مجموع، اگر قرار باشه برای یک شرکت یا مجموعه تحقیقاتی یک زیرساخت AI جدی بسازم، این کانفیگ رو گزینه قابلتوجهی میدونم.
بهخصوص برای LLM، RAG، Fine-tuning، Computer Vision و سرویسدهی همزمان به چند پروژه.
فقط یک نکته رو نباید فراموش کرد: ۴ تا A100 الزاماً یعنی «۴ برابر سرعت» یک A100 نیست. نوع اتصال GPUها و نحوه تقسیم workload خیلی مهمه و A100های PCIe از نظر معماری ارتباطی با سیستمهای HGX مجهز به NVSwitch تفاوت دارن.
ولی در مجموع، داشتن ۴×A100 80GB در یک سرور، هنوز هم برای خیلی از پروژههای حرفهای AI یک پلتفرم بسیار قدرتمنده.
اگر بخوام خیلی ساده بگم:
این دیگه یک کامپیوتر قوی برای اجرای چند مدل AI نیست؛
بیشتر شبیه یک زیرساخت کوچک AI برای یک تیم یا سازمانه.
Post #2334
146
- ❤ 5
- 👍 2