در انتخاب پردازندهٔ گرافیکی برای هوش مصنوعی، معمولاً ابتدا ظرفیت حافظه و سپس توان پردازشی بررسی می‌شود. اگر وزن‌های مدل در حافظه جا شوند و نام قالب عددی آن هم در مشخصات کارت آمده باشد، ممکن است سازگاری تأییدشده تلقی شود. اما هنگام انتقال یک مدل INT8 به نسل جدید GPU، همین فرض می‌تواند به توقف اجرا یا عملکردی بسیار متفاوت با انتظار منجر شود.

در مقالهٔ نحوهٔ انتخاب پردازندهٔ گرافیکی برای هوش مصنوعی معیار اصلی، تناسب کارت با بار کاری و هزینهٔ اجرای آن بود. اینجا یکی از جزئیات مؤثر بر همان تصمیم را بررسی می‌کنیم: آیا نرم‌افزار واقعاً از قابلیتی که برای آن هزینه می‌کنیم استفاده می‌کند؟ محور بحث، استنتاج مدل‌های زبانی است؛ آموزش مدل و دیگر کاربردهای محاسبات صحیح، ارزیابی جداگانه‌ای می‌خواهند.

تفاوت INT8 و FP8

INT8 و FP8 هر دو برای مقدار پایهٔ هر عنصر هشت بیت مصرف می‌کنند، اما نمایش عدد در آن‌ها یکسان نیست. در کوانتیزه‌سازی متداول INT8، عدد حقیقی با یک عدد صحیح و ضریب مقیاس تقریب زده می‌شود. فاصلهٔ مقادیر بازسازی‌شده در یک گروه با مقیاس مشترک یکنواخت است. در FP8، بخشی از بیت‌ها به نما اختصاص دارد و فاصلهٔ اعداد با بزرگی آن‌ها تغییر می‌کند. همان‌طور که در شرح قالب‌های کوانتیزه‌سازی TensorRT دیده می‌شود، FP8 نیز معمولاً به مقیاس‌گذاری نیاز دارد.

FP8 خود چند نمایش دارد. E4M3 چهار بیت نما و سه بیت مانتیسا دارد؛ E5M2 با پنج بیت نما و دو بیت مانتیسا، دامنهٔ بزرگ‌تری را با تفکیک کمتر پوشش می‌دهد. راهنمای Transformer Engine این تفاوت را توضیح می‌دهد. بنابراین ممیزشناور بودن به‌تنهایی تضمین نمی‌کند که خطای یک مدل کمتر شود.

در نام مدل‌های کوانتیزه‌شده، W به وزن‌ها و A به فعال‌سازی‌ها، یعنی داده‌های میانی عبوری از لایه‌ها، اشاره دارد. عبارت W8A8 فقط تعداد بیت این دو گروه را مشخص می‌کند؛ از روی آن نمی‌توان صحیح یا ممیزشناور بودن محاسبات را تعیین کرد.

توصیف مدلمعنیجزئیاتی که باید بررسی شوند
INT8 W8A8وزن و فعال‌سازیِ عملیات مشمول کوانتیزه‌سازی، هشت‌بیتی صحیح‌اندمقیاس‌گذاری، کرنل و لایه‌های مستثنا
FP8 W8A8وزن و فعال‌سازیِ عملیات مشمول کوانتیزه‌سازی، هشت‌بیتی ممیزشناورندنوع FP8، قالب مقیاس و پوشش عملیات
W8A16 با وزن INT8وزن فشرده و فعال‌سازی شانزده‌بیتی استروش بازسازی وزن و دقت واقعی ضرب ماتریسی
FP8 برای KV cacheحافظهٔ کلید و مقدار Attention کوانتیزه شده استقالب وزن‌ها و محاسبات لایه‌ها جدا تعیین می‌شود

این تفکیک در مستندات کوانتیزه‌سازی vLLM نیز دیده می‌شود. حتی نوع انباشت حاصل‌ضرب‌ها مستقل است؛ ورودی INT8 می‌تواند با انباشت INT32 همراه باشد. ازاین‌رو «مدل هشت‌بیتی» توصیف تمام عملیات مدل نیست.

حافظهٔ وزن‌ها، تمام حافظهٔ مورد نیاز نیست

اگر دقیقاً ۷۰ میلیارد پارامتر را هر کدام در یک بایت ذخیره کنیم، اندازهٔ خام وزن‌ها ۷۰ گیگابایت ده‌دهی، معادل حدود ۶۵٫۲ گیبی‌بایت خواهد بود. این مقدار برای INT8 و FP8 یکسان است، اما مقیاس‌ها، لایه‌های با دقت بالاتر، بافرهای موقت و حافظهٔ موتور اجرا را شامل نمی‌شود.

KV cache نیز با طول زمینه و تعداد درخواست‌های فعال تغییر می‌کند. مطابق راهنمای KV cache در vLLM، قالب آن جداگانه تنظیم می‌شود؛ هشت‌بیتی‌کردن وزن‌ها خودبه‌خود آن را هشت‌بیتی نمی‌کند. در نتیجه باید ظرفیت حافظه را با طول ورودی، طول خروجی و تعداد درخواست همزمان مورد نیاز سنجید. بارگذاری موفق مدل هنوز نشان نمی‌دهد که کارت ظرفیت سرویس‌دهی به کاربران را دارد.

این نکته مکمل بحث انواع پردازنده‌های گرافیکی برای هوش مصنوعی است: حافظهٔ بیشتر ممکن است امکان استقرار را فراهم کند، ولی برای برآورد ظرفیت باید مصرف کل سرویس را اندازه گرفت.

تغییر موازنهٔ INT8 و FP8 در B300

یکی از نمونه‌های قابل توجه، تفاوت B200 و B300 است. جدول زیر نرخ‌های اسمی متراکم یا Dense را برای هر GPU نشان می‌دهد. مبنای B200 و B300، جدول ۳ سند فنی معماری Blackwell، صفحهٔ ۲۵ است. اعداد H200 SXM نیز با حذف ضریب تنکی مشخصات سازنده محاسبه شده‌اند.

GPU و پیکربندی مرجعFP8 متراکم؛ TFLOPSINT8 متراکم؛ TOPSنسبت نرخ اسمی FP8 به INT8
H200 SXM۱٬۹۷۹۱٬۹۷۹۱ به ۱
B200 در HGX۴٬۵۰۰۴٬۵۰۰۱ به ۱
B300 در HGX۴٬۵۰۰۱۵۰حدود ۳۰ به ۱
نسبت نرخ اسمی FP8 به INT8 در H200 SXM و HGX B200 برابر یک و در HGX B300 حدود سی است
نسبت توان اسمی متراکم FP8 به INT8 درون هر GPU؛ نه مقایسهٔ سرعت کارت‌ها. توان FP8 در B200 و B300 این جدول برابر است و نسبت حدود ۳۰ در B300 از کاهش توان INT8 حاصل می‌شود.

بلندتر بودن ستون B300 ممکن است در نگاه اول نشانهٔ برتری سرعت آن بر B200 به نظر برسد؛ اما این نمودار اصلاً سرعت دو کارت را با یکدیگر مقایسه نمی‌کند. هر ستون، نسبت توان اسمی FP8 به INT8 را درون همان کارت نشان می‌دهد.

در پیکربندی‌های این جدول، توان اسمی متراکم FP8 در B200 و B300 برابر ۴۵۰۰ ترافلاپس است. آنچه تغییر کرده، توان اسمی متراکم INT8 است که از ۴۵۰۰ به ۱۵۰ تراعملیات‌برثانیه کاهش یافته است. بنابراین نسبت از یک به حدود سی رسیده، چون مخرج کوچک‌تر شده است، نه اینکه توان FP8 افزایش یافته باشد. بزرگ‌تر بودن این نسبت به‌خودی‌خود مزیت محسوب نمی‌شود.

این تفاوت می‌تواند در کاربرد واقعی مهم باشد: اگر عملیات غالب مدل با INT8 اجرا شود و گلوگاه محاسباتی داشته باشد، کاهش توان این مسیر می‌تواند عملکرد را محدود کند. اما از نسبت سی نمی‌توان نتیجه گرفت که مدل روی B300 سی برابر کندتر اجرا می‌شود یا با تبدیل به FP8 سی برابر سریع‌تر خواهد شد. نوع کرنل، انتقال داده، مصرف حافظه و دیگر عملیات مدل در نتیجه دخالت دارند؛ حتی ذخیره‌شدن وزن‌ها به‌صورت INT8 الزاماً به معنی انجام ضرب ماتریسی با INT8 نیست.

پس این نمودار به‌تنهایی دلیلی برای خرید B300 یا کنارگذاشتن GPU موجود نیست. مزایای احتمالی کارت جدید باید در اجرای مدل و بار کاری موردنظر سنجیده شوند. پیام نمودار، اهمیت بررسی مسیر محاسباتی است؛ نه برتری عمومی یک کارت بر دیگری.

در دیتاشیت Blackwell Ultra، صفحهٔ ۵، نرخ INT8 برای HGX B300 برابر ۳۰۷ TOPS تنک است که به ۱۵۳٫۵ TOPS متراکم تبدیل می‌شود؛ سند فنی عدد گرد‌شدهٔ ۱۵۰ را دارد. نمودار از مبنای سند فنی استفاده می‌کند. این اعداد را نباید با ستون GB300 NVL72 یا پیکربندی‌های دیگر ترکیب کرد. تفاوت این سکوها در مقالهٔ DGX، HGX یا سرور معمولی GPU توضیح داده شده است.

افت نرخ اسمی INT8 در این مقایسه مربوط به گذار B200 به B300 است و به همهٔ محصولات Blackwell تعمیم ندارد. همچنین TFLOPS و TOPS در اینجا نرخ دو نوع عملیات متفاوت‌اند؛ نسبت آن‌ها به معنی سی برابر کندتر بودن مدل INT8 نیست.

از مشخصات کارت تا کرنل قابل اجرا

کرنل در این بحث، تابع محاسباتی اجراشونده روی GPU است؛ برای مثال تابع ضرب ماتریسی یک لایه، نه کرنل سیستم‌عامل. وجود یک قالب در جدول سخت‌افزار کافی نیست: دستور باید برای معماری مقصد مجاز باشد، کتابخانه کرنل مناسب داشته باشد و موتور اجرا نیز آن را برای مدل انتخاب کند.

پیش‌چاپ Spec Sheets Are Not Kernels، نسخهٔ دوم، اوت ۲۰۲۶ همین زنجیره را در Blackwell Ultra ممیزی کرده است. مطالعه، بررسی مستندات و کد در نسخه‌های مشخص است و بنچمارک سرعت یا کیفیت ارائه نمی‌کند. جزئیات یافته‌های آن را باید با همان نسخه‌ها خواند:

لایهیافتهٔ مطالعهٔ موردیدامنهٔ نتیجه
دستور GPUدر PTX ۹٫۳، دستور tcgen05.mma با .kind::i8 برای sm_100a آمده، اما sm_103a در فهرست نیستنبود این مسیر نسل پنجم، معادل حذف تمام قابلیت INT8 نیست
CUTLASSمولد کرنل در commit dcf215a تولید INT8 UMMA را برای هدف 103a کنار می‌گذاردقابلیت SM100 را نمی‌توان به SM103 تعمیم داد
vLLMمسیر W8A8 مربوط به SM100 در commit 6c95a641 تابع INT8 نداردقابلیت سخت‌افزاری B200 نیز الزاماً از این مسیر استفاده نمی‌شود
SGLangکرنل INT8 بررسی‌شده در commit b20c375 مسیرهای معماری را تا Hopper پوشش می‌دهدنتیجه دربارهٔ همان کرنل است، نه تمام روش‌های INT8 در SGLang

برای پیگیری مستقیم، محدودیت دستور در مرجع PTX، شرط تولید در مولد CUTLASS و انتخاب عملیات در کد vLLM و کرنل SGLang قابل مراجعه‌اند. این ارجاع‌ها عمداً به commit مشخص متصل‌اند؛ وضعیت نسخهٔ نصب‌شده باید جدا بررسی شود.

در نمونهٔ vLLM، کنترل اولیهٔ سازگاری عبور می‌کند، اما نبود مسیر محاسباتی هنگام نخستین اجرای مدل آشکار می‌شود. بنابراین آزمون سازگاری باید دست‌کم تا تولید خروجی ادامه پیدا کند. استفاده از مدل کوچک‌تر با همان روش کوانتیزه‌سازی می‌تواند این خطا را زودتر نشان دهد؛ تأیید نهایی همچنان به مدل اصلی نیاز دارد، چون ابعاد ماتریس‌ها و معماری مدل می‌توانند انتخاب کرنل را تغییر دهند.

مطالعه همچنین امکان کنارگذاشتن کرنل CUTLASS با VLLM_DISABLED_KERNELS و بررسی مسیر جایگزین Triton را توضیح می‌دهد. این سازوکار روی Ada آزمایش شده و عملکرد آن روی B300 اندازه‌گیری نشده است. پس وجود مسیر جایگزین، به‌تنهایی مبنای توصیهٔ آن برای استقرار B300 نیست.

ثبت نسخهٔ درایور، کتابخانه و موتور اجرا در این ارزیابی ضروری است. همین وابستگی از منظر نگهداری و امنیت در نوشتهٔ امنیت زیرساخت هوش مصنوعی از کرنل و GPU آغاز می‌شود بررسی شده است.

چرا نرخ اسمی، سرعت پاسخ را تعیین نمی‌کند؟

زمان اجرای مدل به خواندن داده از حافظه، ابعاد ماتریس‌ها، میزان موازی‌سازی و کیفیت پیاده‌سازی وابسته است. در راهنمای کارایی ضرب ماتریسی NVIDIA، نسبت عملیات به دادهٔ جابه‌جاشده از عوامل تعیین‌کنندهٔ محدودیت محاسبه یا حافظه است.

در استنتاج مدل زبانی، پردازش ورودی یا Prefill و تولید توکن یا Decode الگوی یکسانی ندارند. افزایش تعداد درخواست‌های همزمان می‌تواند استفاده از توان محاسباتی را بهتر کند، ولی مصرف حافظه و تأخیر صف را نیز تغییر می‌دهد. اگر FP8 و INT8 با پیاده‌سازی‌های متفاوت اجرا شوند، نتیجهٔ مقایسه به کل پیکربندی مربوط است و نمی‌توان همهٔ اختلاف را به قالب عددی نسبت داد.

در اجرای چندGPU، تبادل داده هم به این هزینه اضافه می‌شود. به همین دلیل بررسی رابط‌های PCIe و SXM باید در کنار انتخاب دقت محاسبات انجام شود؛ نرخ بالاتر یک عملیات نمی‌تواند گلوگاه ارتباطی را جبران کند.

تغییر قالب و ارزیابی کیفیت

اگر مسیر FP8 روی سخت‌افزار مقصد مناسب‌تر باشد، بررسی مهاجرت به آن منطقی است. بااین‌حال بازتفسیر بایت‌های INT8 به‌عنوان FP8 تبدیل معتبر مدل نیست. نگاشت عددی و مقیاس‌ها متفاوت‌اند و بهتر است، در صورت دسترسی، کوانتیزه‌سازی مقصد از وزن‌های با دقت بالاتر انجام شود تا خطای تبدیل قبلی نیز به آن تحمیل نشود.

کیفیت به روش آماده‌سازی مدل وابسته است. برای نمونه، پژوهش SmoothQuant با مدیریت مقادیر پرت فعال‌سازی، اجرای W8A8 را با افت ناچیز در آزمون‌های خود نشان می‌دهد. مطالعهٔ مصالحهٔ کیفیت و کارایی کوانتیزه‌سازی در ACL ۲۰۲۵ نیز قالب‌های مختلف را در خانوادهٔ Llama-3.1 و شرایط استقرار متفاوت بررسی می‌کند. نتایج هیچ‌یک، تضمین کیفیت یک مدل فارسی در کاربرد سازمانی نیست.

برای چنین کاربردی، دادهٔ آزمون باید از جنس کار واقعی باشد: استخراج مبلغ و نام از اسناد، حفظ نفی و شرط، پاسخ مستند و تولید خروجی ساخت‌یافته. تغییر جزئی جمله‌بندی با حذف یک شرط قرارداد یا جابه‌جایی یک مبلغ هم‌ارز نیست. مقایسهٔ نسخهٔ کوانتیزه‌شده با مدل مبنا باید این تفاوت خطاها را نشان دهد.

معیار عملی برای انتخاب زیرساخت

در استعلام خرید بهتر است اجرای یک پیکربندی مشخص مطالبه شود: نسخهٔ مدل، روش کوانتیزه‌سازی، موتور اجرا، GPU و بار آزمون. جدول زیر حداقل اطلاعات لازم برای مقایسهٔ پیشنهادها را جمع می‌کند.

موضوعآنچه در گزارش آزمون ثبت می‌شود
مدل و محیطنسخه یا هش وزن‌ها، روش کوانتیزه‌سازی، مدل GPU، درایور و نسخهٔ موتور اجرا
اجرای واقعیتولید خروجی با مدل اصلی و ثبت کرنل منتخب برای عملیات غالب
ظرفیتمصرف حافظه با طول ورودی، خروجی و تعداد درخواست همزمان هدف
کیفیتخطاهای کاربردی در مقایسه با مدل مبنا روی دادهٔ نماینده
پاسخ‌گوییزمان نخستین توکن، زمان تولید توکن‌های بعدی و صدک‌های تأخیر
هزینههزینهٔ ظرفیت قابل استفاده، تبدیل مدل و نگهداری پیکربندی

شرح معیارهای سرویس‌دهی vLLM میان نرخ خام خروجی و ظرفیت منطبق با اهداف سطح خدمت، یا Goodput، تفاوت می‌گذارد. برای یک سرویس تعاملی، تعداد درخواست‌هایی که با کیفیت و تأخیر قابل قبول پاسخ می‌گیرند از بیشترین نرخ توکن در یک آزمون منفرد مفیدتر است. زمان بارگذاری و گرم‌شدن نیز باید از اندازه‌گیری اجرای پایدار جدا باشد.

اگر مدل INT8 موجود نیاز سازمان را تأمین می‌کند، معرفی نسل جدید به‌تنهایی دلیل مهاجرت نیست. برای استقرار تازه نیز باید هزینهٔ خرید را همراه با آماده‌سازی مدل، آزمون کیفیت و نگهداری نرم‌افزار سنجید. ممکن است GPU گران‌تر با مسیر آمادهٔ FP8 اقتصادی‌تر باشد، یا حفظ زیرساخت فعلی نتیجهٔ بهتری بدهد؛ پاسخ را آزمون همان مدل و همان سرویس مشخص می‌کند.

منابع و مبنای اعداد

پیوند هر منبع کنار بحث مربوط آمده است. اعداد نمودار از مشخصات H200 و جدول ۳ سند فنی Blackwell گرفته شده‌اند و دادهٔ قابل دریافت نمودار مبنای هر ردیف را ثبت می‌کند. تاریخ بازبینی این نسخه ۱۷ شهریور ۱۴۰۵ است.

یافته‌های نرم‌افزاری به نسخه‌های درج‌شده در مطالعهٔ اوت ۲۰۲۶ مربوط‌اند. این نوشته آزمون اختصاصی روی B300 گزارش نمی‌کند؛ مطالعهٔ مبنا نیز TensorRT-LLM را ممیزی نکرده است. ارجاع به TensorRT در بخش نخست صرفاً برای توضیح قالب‌های عددی است.