انتخاب سرور GPU با شمردن عبارت «پشتیبانی از ۸ کارت» در کاتالوگ انجام نمیشود. ممکن است یک شاسی هشت اسلات داشته باشد اما در پیکربندی مورد نظر فقط چهار مسیر x16 کامل، توان کافی برای شش کارت یا فضای مکانیکی مناسب برای مدل دیگری از همان GPU را فراهم کند. به همین دلیل واحد درست خرید، نام سرور یا حتی نام خانوادهٔ GPU نیست؛ سرور باید همراه با BOM دقیق و part number دقیق کارت ارزیابی و تحویل شود.
مسئله از کارت شروع میشود
نامهایی مانند H100، RTX 4090 یا RTX PRO 6000 برای سنجش سازگاری کافی نیستند. H100 میتواند PCIe، NVL یا SXM باشد و دو RTX 4090 از دو سازنده نیز ممکن است در طول، ضخامت، کانکتور برق و جهت گردش هوا متفاوت باشند. پیش از انتخاب شاسی باید برای کارت مورد نظر نسل و عرض رابط PCIe، طول و ارتفاع و تعداد اسلات، توان، نوع کانکتور، active یا passive بودن خنککننده و نیاز احتمالی به NVLink bridge یا قابلیتهای نرمافزاری مشخص شود.
همین تفاوت توضیح میدهد چرا روشنشدن کارت در یک شیار معیار سازگاری نیست. کارت passive مرکز داده برای جریان هوای پرفشار front-to-back طراحی شده است، در حالی که کارت مصرفی open-air گرما را داخل شاسی رها میکند. چند کارت سه یا چهاراسلاتی ممکن است از نظر هندسی در سرور جا شوند اما ورودی هوای یکدیگر را ببندند. فضای لازم برای خمشدن کابل برق نیز باید در امتداد کارت محاسبه شود. در نتیجه تأیید سازگاری باید مربوط به همان SKU و همان kit نصب باشد، نه به تراشهای با نام مشابه.
PCIe و توپولوژی داخلی سرور
PCIe میان نسلها backward compatible است و لینک در بالاترین سرعت مشترک دو طرف کار میکند. کارت PCIe 4.0 روی سرور PCIe 5.0 معمولاً با سرعت نسل چهار کار میکند؛ کارت PCIe 5.0 نیز ممکن است روی نسل چهار راهاندازی شود، اما تمامسرعت نیست و باید توسط سازندهٔ سرور تأیید شود. این افت سرعت در بارهایی که بیشتر زمان را داخل حافظهٔ GPU میگذرانند الزاماً اثر بزرگی ندارد، ولی در offload، GPUDirect Storage، تبادل مکرر با CPU یا ورودیهای حجیم میتواند گلوگاه بسازد. بنابراین «کار میکند» و «بهینه است» دو پاسخ متفاوتاند.
وجود شیار فیزیکی x16 نیز به معنی مسیر الکتریکی x16 نیست. تعداد laneهای CPU، riserها و PCIe switchها تعیین میکنند هر کارت از چه مسیری به CPU و NIC برسد و آیا پهنایباند میان چند اسلات تقسیم میشود. در سرور دوپردازندهای نیز هر گروه اسلات معمولاً به یک قلمرو NUMA تعلق دارد. اگر GPU زیر یک CPU و NIC یا داده زیر CPU دیگر قرار گیرد، ترافیک از لینک بین دو سوکت عبور میکند و ممکن است latency و پهنایباند مؤثر را تغییر دهد.
از فروشنده باید block diagram همان پیکربندی، نگاشت GPU و NIC به CPU، عرض و سرعت negotiated link و نتیجهٔ ابزار توپولوژی پس از نصب خواسته شود. خروجی nvidia-smi topo -m فقط یک ضمیمهٔ فنی نیست؛ نشان میدهد سامانهای که تحویل شده با تصویری که در استعلام فروخته شده یکسان است یا خیر.
برق و خنککاری بخشی از ظرفیت محاسباتیاند
جمع TDP کارتها نقطهٔ آغاز محاسبهٔ توان است، نه پایان آن. CPU، RAM، دیسک، NIC و فنها نیز مصرف دارند و باید بار گذرا، راندمان پاور و سیاست redundancy در نظر گرفته شود. سروری که پس از خروج یک PSU روشن میماند اما برای ادامهٔ بار کامل GPU مجبور به power cap یا throttling میشود، افزونگی واقعی در ظرفیت نامی ندارد. تعداد و توان PSU، کابل تأییدشدهٔ هر کارت، سقف توان riser، جریان رک و PDU و محدودهٔ دمای ورودی باید در BOM و معیار پذیرش ثبت شوند.
همین قاعده دربارهٔ خنککاری برقرار است. «پشتیبانی از ۸ GPU» ممکن است فقط با fan kit خاص، در دمای ورودی معین یا با کارت passive تعریفشده در QuickSpecs معتبر باشد. واترکولینگ نیز مسئله را حذف نمیکند؛ radiator، pump، نگهداشت، احتمال نشتی و خنککردن VRM و حافظه به طراحی و تعهد جداگانه نیاز دارند. معیار قبولی آن است که سامانه در بار پیوسته و بدترین وضعیت مجاز مرکز داده، بدون thermal یا power throttling کار کند.
CPU، RAM، ذخیرهسازی و شبکه را از روی جریان داده انتخاب کنید
برای CPU و RAM نسبت جادویی وجود ندارد. tokenization، decode تصویر و ویدئو، augmentation، retrieval و preprocessing ممکن است CPUمحور باشند، در حالی که یک inference ساده بیشتر زمان را داخل GPU بگذراند. تعداد laneهای PCIe و کانالهای حافظه گاهی از تعداد هسته مهمتر است. نیاز RAM نیز به cache، offload، تعداد کاربر و روش بارگذاری داده وابسته است. تنها روش قابل دفاع، اندازهگیری مصرف مراحل مختلف در prototype و افزودن حاشیهٔ رشد مشخص است.
در ذخیرهسازی باید دیسک سیستمعامل، فضای سریع محلی برای dataset و checkpoint و ذخیرهسازی پایدار مشترک از هم جدا شوند. در شبکه نیز پرسش اصلی این نیست که «۱۰، ۱۰۰ یا ۴۰۰ گیگابیت؟»؛ باید معلوم شود داده از کجا وارد میشود، آیا چند node یک job مشترک دارند، RDMA یا GPUDirect لازم است و oversubscription چقدر خواهد بود. GPUای که منتظر storage یا شبکه میماند با افزایش تعداد کارتها سریعتر نمیشود.
نقش هر یک از این اجزا در مقالهٔ اجزای سکوی سرور برای پردازش GPU با جزئیات بیشتری بررسی شده است.
مدل شاسی را نخرید؛ پیکربندی را بخرید
یک مدل سرور با riser، backplane، CPU، PSU، fan kit و firmwareهای مختلف عرضه میشود و همهٔ این پیکربندیها ظرفیت GPU یکسانی ندارند. برنامهٔ NVIDIA-Certified Systems نیز پیکربندی را از نظر حرارتی، مکانیکی، توان و signal integrity میآزماید، نه صرفاً نام روی قاب را. بنابراین عبارت «این مدل سرور در فهرست NVIDIA هست» بدون تطبیق پیکربندی، ضمانت سازگاری نیست.
جدول تعاملی همین مجموعه برای کوتاهکردن فهرست گزینهها ساخته شده است. ابتدا کارت دقیق انتخاب میشود و سپس نسل PCIe، تعداد و عرض کارت، نوع خنککاری، توان، ارتفاع U و عمق رک نتایج را محدود میکنند. وضعیت «نیازمند بررسی BOM» به معنی سازگاری قطعی نیست؛ فقط نشان میدهد شاسی از نظر اولیه محتمل است و باید در Product Guide یا QuickSpecs و سپس در پیشنهاد رسمی فروشنده تأیید شود.
در استعلام نهایی باید part number کارت، riser، کابل، fan kit، PSU و NIC ذکر شود؛ نسخهٔ BIOS، BMC، firmware و driver نیز در زمان تحویل ثبت گردد. فروشنده باید عرض و سرعت لینک هر GPU را در ظرفیت کامل و تعهد خود را برای رفع throttling، خطاهای XID و PCIe روشن کند. قطعاتی که برای افزودن GPU در آینده لازماند نیز باید از ابتدا مشخص باشند؛ بسیاری از سرورها بدون kitهایی که همراه پیکربندی اولیه سفارش داده نشدهاند، بعداً بهسادگی قابل توسعه نیستند.
آزمون پذیرش، جای بروشور را میگیرد
پیش از پرداخت نهایی، سرور باید دستکم ۲۴ تا ۷۲ ساعت زیر بار پیوسته قرار گیرد و دمای GPU و حافظه، clock، power draw، throttling، سرعت و عرض PCIe، خطاهای AER، XID و ECC ثبت شوند. برای سامانهٔ چندGPU، توپولوژی GPU/NIC/NUMA و کارایی collective communication نیز باید سنجیده شود. آزمون مصنوعی بهتنهایی کافی نیست؛ یک یا چند workload واقعی سازمان باید اجرا شوند تا مشخص شود CPU، storage و شبکه میتوانند کارتها را تغذیه کنند. رفتار سامانه پس از خروج مجاز یک PSU نیز نشان میدهد افزونگی ادعاشده واقعی است یا فقط روشنماندن سرور را تضمین میکند.
سرور بهینه شاسیای نیست که بیشترین GPU را جا بدهد؛ سامانهای است که کارتهای مشخص را با لینک درست، توان پایدار، هوای کافی و توپولوژی قابل اندازهگیری به کار بگیرد. خریدی که این جزئیات را به بعد از تحویل موکول کند، در واقع ریسک سازگاری فروشنده را به خریدار منتقل کرده است.
