انتخاب سرور GPU با شمردن عبارت «پشتیبانی از ۸ کارت» در کاتالوگ انجام نمی‌شود. ممکن است یک شاسی هشت اسلات داشته باشد اما در پیکربندی مورد نظر فقط چهار مسیر x16 کامل، توان کافی برای شش کارت یا فضای مکانیکی مناسب برای مدل دیگری از همان GPU را فراهم کند. به همین دلیل واحد درست خرید، نام سرور یا حتی نام خانوادهٔ GPU نیست؛ سرور باید همراه با BOM دقیق و part number دقیق کارت ارزیابی و تحویل شود.

مسئله از کارت شروع می‌شود

نام‌هایی مانند H100، RTX 4090 یا RTX PRO 6000 برای سنجش سازگاری کافی نیستند. H100 می‌تواند PCIe، NVL یا SXM باشد و دو RTX 4090 از دو سازنده نیز ممکن است در طول، ضخامت، کانکتور برق و جهت گردش هوا متفاوت باشند. پیش از انتخاب شاسی باید برای کارت مورد نظر نسل و عرض رابط PCIe، طول و ارتفاع و تعداد اسلات، توان، نوع کانکتور، active یا passive بودن خنک‌کننده و نیاز احتمالی به NVLink bridge یا قابلیت‌های نرم‌افزاری مشخص شود.

همین تفاوت توضیح می‌دهد چرا روشن‌شدن کارت در یک شیار معیار سازگاری نیست. کارت passive مرکز داده برای جریان هوای پرفشار front-to-back طراحی شده است، در حالی که کارت مصرفی open-air گرما را داخل شاسی رها می‌کند. چند کارت سه یا چهاراسلاتی ممکن است از نظر هندسی در سرور جا شوند اما ورودی هوای یکدیگر را ببندند. فضای لازم برای خم‌شدن کابل برق نیز باید در امتداد کارت محاسبه شود. در نتیجه تأیید سازگاری باید مربوط به همان SKU و همان kit نصب باشد، نه به تراشه‌ای با نام مشابه.

PCIe و توپولوژی داخلی سرور

PCIe میان نسل‌ها backward compatible است و لینک در بالاترین سرعت مشترک دو طرف کار می‌کند. کارت PCIe 4.0 روی سرور PCIe 5.0 معمولاً با سرعت نسل چهار کار می‌کند؛ کارت PCIe 5.0 نیز ممکن است روی نسل چهار راه‌اندازی شود، اما تمام‌سرعت نیست و باید توسط سازندهٔ سرور تأیید شود. این افت سرعت در بارهایی که بیشتر زمان را داخل حافظهٔ GPU می‌گذرانند الزاماً اثر بزرگی ندارد، ولی در offload، GPUDirect Storage، تبادل مکرر با CPU یا ورودی‌های حجیم می‌تواند گلوگاه بسازد. بنابراین «کار می‌کند» و «بهینه است» دو پاسخ متفاوت‌اند.

وجود شیار فیزیکی x16 نیز به معنی مسیر الکتریکی x16 نیست. تعداد laneهای CPU، riserها و PCIe switchها تعیین می‌کنند هر کارت از چه مسیری به CPU و NIC برسد و آیا پهنای‌باند میان چند اسلات تقسیم می‌شود. در سرور دوپردازنده‌ای نیز هر گروه اسلات معمولاً به یک قلمرو NUMA تعلق دارد. اگر GPU زیر یک CPU و NIC یا داده زیر CPU دیگر قرار گیرد، ترافیک از لینک بین دو سوکت عبور می‌کند و ممکن است latency و پهنای‌باند مؤثر را تغییر دهد.

از فروشنده باید block diagram همان پیکربندی، نگاشت GPU و NIC به CPU، عرض و سرعت negotiated link و نتیجهٔ ابزار توپولوژی پس از نصب خواسته شود. خروجی nvidia-smi topo -m فقط یک ضمیمهٔ فنی نیست؛ نشان می‌دهد سامانه‌ای که تحویل شده با تصویری که در استعلام فروخته شده یکسان است یا خیر.

برق و خنک‌کاری بخشی از ظرفیت محاسباتی‌اند

جمع TDP کارت‌ها نقطهٔ آغاز محاسبهٔ توان است، نه پایان آن. CPU، RAM، دیسک، NIC و فن‌ها نیز مصرف دارند و باید بار گذرا، راندمان پاور و سیاست redundancy در نظر گرفته شود. سروری که پس از خروج یک PSU روشن می‌ماند اما برای ادامهٔ بار کامل GPU مجبور به power cap یا throttling می‌شود، افزونگی واقعی در ظرفیت نامی ندارد. تعداد و توان PSU، کابل تأییدشدهٔ هر کارت، سقف توان riser، جریان رک و PDU و محدودهٔ دمای ورودی باید در BOM و معیار پذیرش ثبت شوند.

همین قاعده دربارهٔ خنک‌کاری برقرار است. «پشتیبانی از ۸ GPU» ممکن است فقط با fan kit خاص، در دمای ورودی معین یا با کارت passive تعریف‌شده در QuickSpecs معتبر باشد. واترکولینگ نیز مسئله را حذف نمی‌کند؛ radiator، pump، نگهداشت، احتمال نشتی و خنک‌کردن VRM و حافظه به طراحی و تعهد جداگانه نیاز دارند. معیار قبولی آن است که سامانه در بار پیوسته و بدترین وضعیت مجاز مرکز داده، بدون thermal یا power throttling کار کند.

CPU، RAM، ذخیره‌سازی و شبکه را از روی جریان داده انتخاب کنید

برای CPU و RAM نسبت جادویی وجود ندارد. tokenization، decode تصویر و ویدئو، augmentation، retrieval و preprocessing ممکن است CPUمحور باشند، در حالی که یک inference ساده بیشتر زمان را داخل GPU بگذراند. تعداد laneهای PCIe و کانال‌های حافظه گاهی از تعداد هسته مهم‌تر است. نیاز RAM نیز به cache، offload، تعداد کاربر و روش بارگذاری داده وابسته است. تنها روش قابل دفاع، اندازه‌گیری مصرف مراحل مختلف در prototype و افزودن حاشیهٔ رشد مشخص است.

در ذخیره‌سازی باید دیسک سیستم‌عامل، فضای سریع محلی برای dataset و checkpoint و ذخیره‌سازی پایدار مشترک از هم جدا شوند. در شبکه نیز پرسش اصلی این نیست که «۱۰، ۱۰۰ یا ۴۰۰ گیگابیت؟»؛ باید معلوم شود داده از کجا وارد می‌شود، آیا چند node یک job مشترک دارند، RDMA یا GPUDirect لازم است و oversubscription چقدر خواهد بود. GPUای که منتظر storage یا شبکه می‌ماند با افزایش تعداد کارت‌ها سریع‌تر نمی‌شود.

نقش هر یک از این اجزا در مقالهٔ اجزای سکوی سرور برای پردازش GPU با جزئیات بیشتری بررسی شده است.

مدل شاسی را نخرید؛ پیکربندی را بخرید

یک مدل سرور با riser، backplane، CPU، PSU، fan kit و firmwareهای مختلف عرضه می‌شود و همهٔ این پیکربندی‌ها ظرفیت GPU یکسانی ندارند. برنامهٔ NVIDIA-Certified Systems نیز پیکربندی را از نظر حرارتی، مکانیکی، توان و signal integrity می‌آزماید، نه صرفاً نام روی قاب را. بنابراین عبارت «این مدل سرور در فهرست NVIDIA هست» بدون تطبیق پیکربندی، ضمانت سازگاری نیست.

جدول تعاملی همین مجموعه برای کوتاه‌کردن فهرست گزینه‌ها ساخته شده است. ابتدا کارت دقیق انتخاب می‌شود و سپس نسل PCIe، تعداد و عرض کارت، نوع خنک‌کاری، توان، ارتفاع U و عمق رک نتایج را محدود می‌کنند. وضعیت «نیازمند بررسی BOM» به معنی سازگاری قطعی نیست؛ فقط نشان می‌دهد شاسی از نظر اولیه محتمل است و باید در Product Guide یا QuickSpecs و سپس در پیشنهاد رسمی فروشنده تأیید شود.

در استعلام نهایی باید part number کارت، riser، کابل، fan kit، PSU و NIC ذکر شود؛ نسخهٔ BIOS، BMC، firmware و driver نیز در زمان تحویل ثبت گردد. فروشنده باید عرض و سرعت لینک هر GPU را در ظرفیت کامل و تعهد خود را برای رفع throttling، خطاهای XID و PCIe روشن کند. قطعاتی که برای افزودن GPU در آینده لازم‌اند نیز باید از ابتدا مشخص باشند؛ بسیاری از سرورها بدون kitهایی که همراه پیکربندی اولیه سفارش داده نشده‌اند، بعداً به‌سادگی قابل توسعه نیستند.

آزمون پذیرش، جای بروشور را می‌گیرد

پیش از پرداخت نهایی، سرور باید دست‌کم ۲۴ تا ۷۲ ساعت زیر بار پیوسته قرار گیرد و دمای GPU و حافظه، clock، power draw، throttling، سرعت و عرض PCIe، خطاهای AER، XID و ECC ثبت شوند. برای سامانهٔ چندGPU، توپولوژی GPU/NIC/NUMA و کارایی collective communication نیز باید سنجیده شود. آزمون مصنوعی به‌تنهایی کافی نیست؛ یک یا چند workload واقعی سازمان باید اجرا شوند تا مشخص شود CPU، storage و شبکه می‌توانند کارت‌ها را تغذیه کنند. رفتار سامانه پس از خروج مجاز یک PSU نیز نشان می‌دهد افزونگی ادعاشده واقعی است یا فقط روشن‌ماندن سرور را تضمین می‌کند.

سرور بهینه شاسی‌ای نیست که بیشترین GPU را جا بدهد؛ سامانه‌ای است که کارت‌های مشخص را با لینک درست، توان پایدار، هوای کافی و توپولوژی قابل اندازه‌گیری به کار بگیرد. خریدی که این جزئیات را به بعد از تحویل موکول کند، در واقع ریسک سازگاری فروشنده را به خریدار منتقل کرده است.