برای یک شرکت ایرانی، انتخاب میان خرید سرور، اجارهٔ GPU و API از صورتحساب تومانی شروع میشود، اما به همانجا ختم نمیشود. تیم فنی میخواهد بداند مدل با متن فارسی و اسناد سازمان چه میکند؛ مدیر مالی باید هزینهٔ ماهانه و پولی را که در سختافزار میخوابد ببیند؛ مدیر خدمت هم میپرسد اگر ارتباط خارجی مختل شد یا یک سرور از کار افتاد، پاسخگویی چه میشود. تصمیم خوب باید به هر سه پرسش جواب بدهد.
فرض کنیم دستیار یک فروشگاه، شرکت بیمه یا واحد پشتیبانی را میسازیم: بخشی از درخواستها کوتاهاند و بخشی به خواندن اسناد و سابقهٔ گفتگو نیاز دارند. میتوانیم مصرف مدل را از یک عرضهکنندهٔ ایرانی API بخریم، مدل بازوزن را روی GPU اجارهای اجرا کنیم یا زیرساخت خودمان را داشته باشیم. تفاوت اقتصادی این راهها وقتی معلوم میشود که هزینهٔ انجام همان کار، با کیفیت فارسی و زمان پاسخ قابلقبول را کنار هم بگذاریم.
برای یکسانکردن مبنای مقایسه، ابتدا مدل متناسب با کاربرد و حافظه و سختافزار لازم برای اجرای آن را مشخص کنید؛ اختلاف اندازهٔ مدل و تعداد درخواستهای همزمان میتواند هزینهٔ هر سه روش را تغییر دهد.
قیمتها در ۲۵ شهریور ۱۴۰۵، برابر با ۱۶ سپتامبر ۲۰۲۶ از صفحات عرضهکنندگان گردآوری شدهاند؛ فقط عرضهٔ RAM در ۲۸ شهریور، ۱۹ سپتامبر بهروزرسانی شده است. مبنای تبدیل تعرفههای دلاری، دلار ۲۳۰ هزار تومانی است. قیمت دلارِ «الان»؟ الان یا الان؟ تا این جمله را بخوانید، شاید باید دوباره حساب کنیم! قیمتهای عرضه فروشندگان بدون تبدیل مجدد ارایه شدهاند؛ مالیات و هزینههایی که جدا به فاکتور اضافه شوند، در جمعها نیستند.
اول، واحد مقایسه را درست انتخاب کنیم
صد هزار درخواست، صد هزار کار انجامشده نیست. ممکن است پاسخ دستیار پشتیبانی نیاز به اصلاح داشته باشد، استخراج اطلاعات یک فاکتور دوباره اجرا شود یا عامل برنامهنویسی برای یک کار چند بار مدل را صدا بزند. معیار اقتصادی مفید، هزینهٔ هر کار پذیرفتهشده است: کل هزینهٔ خدمت در ماه را بر تعداد کارهایی تقسیم کنیم که معیار کیفیت و زمان پاسخ را گذراندهاند. تلاشهای ناموفق و زمان بازبینی هم هزینه دارند.
در فارسی، طول ظاهری متن معیار مطمئنی برای مصرف نیست. یک نامهٔ اداری با نیمفاصله، شمارهٔ پرونده و واژههای انگلیسی ممکن است در دو مدل تعداد توکن متفاوتی داشته باشد. برای مقایسهٔ کیفیت، نمونههایی از کار واقعی لازم است؛ همان روشی که در سنجش مدلهای زبانی برای فارسی توضیح داده شده است. برای برآورد مالی، گزارش مصرف همان مدل مبناست.
میانگین ماهانه هم جای اوج مراجعه را نمیگیرد. صد هزار پرسش پخششده در ماه با هجوم مراجعه در روز ثبتنام یا پایان مهلت یک فراخوان، زیرساخت یکسانی نمیخواهد. هزینهٔ سرور از ظرفیت لازم در ساعت شلوغ تأثیر میگیرد، حتی اگر بیشتر روز بیکار بماند. این تفاوت در گذار از یک کاربر به سرویس سازمانی مهم میشود.
| موضوع هزینه | خرید و اجرای داخلی | GPU اجارهای | API مصرفی |
|---|---|---|---|
| پرداخت شروع | سیستم، نصب و آمادهسازی محل | آمادهسازی محیط و مدل | اتصال برنامه و شارژ اعتبار |
| پرداخت جاری | میزبانی، انرژی، نگهداری و هزینهٔ سرمایه | زمان تخصیص سرور و خدمات همراه | مصرف مدل و هزینهٔ ثابت احتمالی سرویس |
| در ساعتهای خلوت | سرمایه و هزینهٔ نگهداری باقی است | ماشین تخصیصیافته ممکن است همچنان هزینه داشته باشد | مصرف مدل کم میشود |
| مسئول اجرای مدل | تیم سازمان | در اجارهٔ خام، تیم سازمان | عرضهکنندهٔ مدل |
| برنامه و اسناد | بر عهدهٔ سازمان | بر عهدهٔ سازمان | همچنان بر عهدهٔ سازمان، مگر در محصول مدیریتشده |
| ادامهٔ کار هنگام خرابی | نیازمند ظرفیت جایگزین | وابسته به طراحی و قرارداد | وابسته به مسیر جایگزین و ارائهدهندهٔ بالادستی |
API ایرانی: قیمت توکن، تمام مبلغ پرداخت نیست
تعرفهٔ AIaaS آروانکلاد برای هر میلیون توکن ورودی و خروجی به تومان منتشر شده است. سه مدل زیر برای محاسبه انتخاب شدهاند؛ این جدول مقایسهٔ قیمت مصرف است و دربارهٔ برتری کیفیت فارسی آنها داوری نمیکند.
| مدل در آروانکلاد | ورودی، تومان برای یک میلیون توکن | خروجی، تومان برای یک میلیون توکن |
|---|---|---|
| GPT-4o mini | ۳۳٬۱۲۰ | ۱۳۲٬۴۸۰ |
| GPT-4.1 mini | ۸۸٬۳۲۰ | ۳۵۳٬۲۸۰ |
| GPT-5 mini | ۵۵٬۲۰۰ | ۴۴۱٬۶۰۰ |
برای مقایسه با فروشندگان دیگر، یک مدل مشترک را نگه داریم. در جدول عمومی گپجیپیتی، صفحهٔ GPT-4.1 Mini در اول ایآی و فهرست مدلهای لیارا، تعرفهٔ مصرف این مدل چنین است:
| عرضهکننده | ورودی GPT-4.1 Mini، دلار برای یک میلیون توکن | خروجی GPT-4.1 Mini، دلار برای یک میلیون توکن |
|---|---|---|
| گپجیپیتی | 0.40 | 1.60 |
| اول ایآی | 0.40 | 1.60 |
| لیارا | 0.40 | 1.60 |
با دلار ۲۳۰ هزار تومانی، تعرفهٔ این جدول معادل ۹۲ هزار تومان برای یک میلیون توکن ورودی و ۳۶۸ هزار تومان برای یک میلیون توکن خروجی است. این تبدیل محاسباتی است؛ عدد قابل پرداخت در پنل هر سرویس به نرخ تسویهٔ همان سرویس بستگی دارد.
قیمت توکن این سه ردیف برابر است، اما هزینهٔ کل الزاماً برابر نیست. در تعرفهٔ پلنهای لیارا، میرزاخانی ماهانه ۶۰۰ هزار تومان و تورینگ ۱ میلیون و ۵۰ هزار تومان هزینهٔ جدا از توکن دارند. برای صد هزار فراخوانی کوتاه، با الگوی دو هزار توکن ورودی و پانصد توکن خروجی در هر فراخوانی، مصرف مدل ۱۶۰ دلار میشود: دویست میلیون توکن ورودی با نرخ ۰٫۴ دلار و پنجاه میلیون توکن خروجی با نرخ ۱٫۶ دلار. با نرخ تبدیل این یادداشت، حاصل ۳۶ میلیون و ۸۰۰ هزار تومان است؛ با افزودن پلن میرزاخانی، جمع این دو قلم ۳۷ میلیون و ۴۰۰ هزار تومان میشود. این مبلغ، برآورد همان دو قلم با نرخ تبدیل مشخص است و هزینهٔ سرور برنامه، مالیات یا دیگر اقلام احتمالی را شامل نمیشود.
جدول گپجیپیتی مربوط به API توسعهدهندگان است. خرید اشتراک محیط گفتگو، بودجهٔ اتصال نرمافزار سازمانی محسوب نمیشود. در یک شرکت ممکن است کارکنان اشتراک چت داشته باشند و محصول شرکت نیز جداگانه از API استفاده کند؛ این دو هزینه باید در دو ردیف بودجه ثبت شوند.
برای دستیار اسناد نیز مصرف مدل پاسخگو فقط بخشی از هزینه است. آروان برای پایگاه دانش، دیتابیس اختصاصی و مصرف embedding را جدا مطرح میکند. در پیادهسازی خودمان هم استخراج متن، نگهداری سند، جستوجو و کنترل دسترسی از صورت مسئله حذف نمیشوند؛ فقط شکل پرداختشان عوض میشود.
صد هزار درخواست در ماه چقدر هزینه دارد؟
دو الگوی مشخص را حساب کنیم. در پرسش کوتاه، هر فراخوانی دو هزار توکن ورودی و پانصد توکن خروجی دارد. در پرسش اسنادی، هشت هزار توکن ورودی و هزار توکن خروجی فرض شده است. تعداد فراخوانی و طول ورودی و خروجی، ورودیهای انتخابشده برای مقایسهاند؛ میانگین اندازهگیریشدهٔ یک سرویس فارسی نیستند. اعداد زیر برای صد هزار فراخوانی و بر اساس تعرفهٔ تومانی آروان محاسبه شدهاند؛ کش، ابزارها و تلاش دوباره در این مثال نیستند. منظور از خروجی، تمام توکنهای قابلصورتحساب است، نه صرفاً طول متن دیدهشده توسط کاربر.
| مدل | صد هزار پرسش کوتاه، تومان | صد هزار پرسش اسنادی، تومان |
|---|---|---|
| GPT-4o mini | ۱۳٬۲۴۸٬۰۰۰ | ۳۹٬۷۴۴٬۰۰۰ |
| GPT-4.1 mini | ۳۵٬۳۲۸٬۰۰۰ | ۱۰۵٬۹۸۴٬۰۰۰ |
| GPT-5 mini | ۳۳٬۱۲۰٬۰۰۰ | ۸۸٬۳۲۰٬۰۰۰ |
برای نمونه، در الگوی کوتاه GPT-4.1 mini، دویست میلیون توکن ورودی و پنجاه میلیون توکن خروجی داریم. سهم هرکدام ۱۷٬۶۶۴٬۰۰۰ تومان میشود و جمع آنها به حدود ۳۵٫۳ میلیون تومان میرسد. همین تعداد پرسش با ورودی اسنادی، حدود ۱۰۶ میلیون تومان مصرف دارد. در نتیجه، تعداد کاربران بهتنهایی بودجه را توضیح نمیدهد؛ طول سابقهٔ گفتگو و متن اسنادی که به مدل میفرستیم هم تعیینکننده است.
این نکته برای دستیارهای فارسی سازمانی خیلی عملی است. اگر برای هر سوال، چندین صفحه بخشنامهٔ کمارتباط یا تمام تاریخچهٔ گفتگو را دوباره بفرستیم، هزینهٔ ورودی را بالا بردهایم، بدون اینکه لزوماً جواب بهتر شده باشد. انتخاب درست embedding و reranker میتواند به رساندن قطعات مرتبطتر کمک کند. در عامل برنامهنویسی نیز یک درخواست کاربر ممکن است چندین رفتوبرگشت داشته باشد؛ بودجهٔ آن با یک پاسخ کوتاه قابل مقایسه نیست.
برای تصمیم نهایی، هزینهٔ ثبتشده در صورتحساب را بر تعداد کارهای پذیرفتهشده در آزمون همان سرویس تقسیم میکنیم. بدون اندازهگیری کیفیت فارسی و تعداد تلاشها، نمیتوان از جدول قیمت توکن نتیجه گرفت کدام گزینه ارزانترین پاسخ قابل استفاده را تحویل میدهد.
اجارهٔ GPU: ساعت روشنبودن را میخریم
برای مقایسهٔ هزینهٔ اجاره در ایران، چند پلن از ایرانسرور، از شرکتهای گروه گرینوب، و ابر فردوسی در کنار هم قرار گرفتهاند. قیمتها متعلق به پیکربندی کامل همان ردیف هستند؛ برابر بودن نام کارت به معنی برابر بودن RAM، CPU یا فضای ذخیرهسازی نیست.
| عرضهکننده و پلن | GPU و منابع همراه | شیوهٔ پرداخت | قیمت اعلامشده، تومان |
|---|---|---|---|
| ایرانسرور، RTX3090-Start | حافظهٔ GPU: ۲۴؛ CPU: ۱۶ هسته؛ RAM: ۳۰؛ SSD: ۳۳۰ گیگابایت | ماهانه | ۴۰٬۵۰۰٬۰۰۰ |
| ایرانسرور، RTX4090-Smart | حافظهٔ GPU: ۲۴؛ CPU: ۳۲ هسته؛ RAM: ۹۰؛ SSD: ۷۰۰ گیگابایت | ماهانه | ۹۱٬۰۰۰٬۰۰۰ |
| ایرانسرور، A6000-Light | حافظهٔ GPU: ۴۸؛ CPU: ۱۶ هسته؛ RAM: ۶۰؛ SSD: ۷۰۰ گیگابایت | ماهانه | ۱۱۷٬۰۰۰٬۰۰۰ |
| ایرانسرور، RTX4090-Smart | همان پیکربندی ردیف ماهانه | ساعتی | ۱۸۹٬۰۰۰ |
| ابر فردوسی، GPU-4090-8c-16r-100d-x1 | یک RTX 4090 با ۲۴ گیگابایت؛ CPU: ۸ هستهٔ مجازی؛ RAM: ۱۶؛ دیسک: ۱۰۰ گیگابایت | ساعتی | ۷۹٬۳۰۰ |
پلنهای 3090 و 4090 جدول ایرانسرور در شیراز و A6000 در تبریز معرفی شدهاند؛ هر سه یک ترابایت ترافیک دارند. ابر فردوسی نیز سرویس GPU را روی زیرساخت داخل ایران عرضه میکند. محدودیت RAM در ردیف ارزانتر فردوسی مهم است: برای بعضی مدلها، بارگذاری وزنها، تبدیل قالب یا اجرای اجزای RAG به حافظهٔ میزبان بیشتری نیاز دارد. بررسی حافظه و سختافزار راهنمای مدلهای زبانی کمک میکند چنین تفاوتی پشت نام 4090 پنهان نماند.
ساعتیبودن وقتی ارزش دارد که کار واقعاً مقطعی باشد. برای نمونهٔ محاسباتیِ پنجاه ساعت تخصیص منابع، ضرب تعرفهٔ ساعتی در پنجاه، برای پلن فردوسی ۳٬۹۶۵٬۰۰۰ تومان و برای پلن Smart ایرانسرور ۹٬۴۵۰٬۰۰۰ تومان میشود. برای یک دورهٔ سیروزه، یعنی ۷۲۰ ساعت، همان Smart با نرخ ساعتی ۱۳۶٬۰۸۰٬۰۰۰ تومان هزینه دارد؛ در حالی که بستهٔ ماهانهاش ۹۱ میلیون تومان اعلام شده است. تقسیم ۹۱ میلیون بر ۱۸۹ هزار، برابری حسابی دو روش پرداخت را در حدود ۴۸۱٫۵ ساعت نشان میدهد. طول دوره و شرایط بستهٔ ماهانه نیز باید با دورهٔ استفاده منطبق باشد؛ ۷۲۰ ساعت برای همین مثال سیروزه در نظر گرفته شده است.
در مورد فردوسی، ضرب سادهٔ ۷۹٬۳۰۰ در ۷۲۰، ۵۷٬۰۹۶٬۰۰۰ تومان میشود؛ این عدد معادل استفادهٔ پیوسته با نرخ ساعتی است، نه تعرفهٔ یک بستهٔ ماهانه. خاموشکردن پردازش مدل داخل سیستمعامل نیز لزوماً منابع اجارهای را آزاد نمیکند. برای یک پروژهٔ سهروزه، زمان دانلود وزنها، آمادهسازی و اجرای ناموفق هم ممکن است بخشی از زمان تخصیص ماشین باشد.
اجاره یک مزیت دیگر هم دارد: پیش از خواباندن سرمایه در خرید، میتوانیم نسخهٔ مدل و الگوی بار واقعی را روی سختافزار امتحان کنیم. خروجی این دوره باید روشن کند چند پاسخ قابلقبول در ساعت شلوغ تحویل میگیریم و حافظه کجا کم میآید. یک ماه اجاره که جلوی خرید پیکربندی نامناسب را بگیرد، صرفاً «هزینهٔ اضافه» نیست.
خرید: قیمت کارت را با قیمت خدمت اشتباه نگیریم
برای خرید، یک ایستگاه کاری تککارت را حساب کنیم: RTX 4090 با ۲۴ گیگابایت حافظه، پردازندهٔ شانزدههستهای Ryzen 9، رم ۶۴ گیگابایتی و SSD دوترابایتی. این ترکیب برای اجرای مدل و پردازش اسناد در نظر گرفته شده است؛ CPU و RAM میزبان باید بار آمادهسازی داده و اجزای RAG را هم تحمل کنند. قیمت هر قلم، همان مبلغ درجشده در صفحهٔ فروشنده در روز بررسی است:
| قطعه | مدل و پیکربندی | فروشنده و قیمت، تومان |
|---|---|---|
| کارت گرافیک | NVIDIA RTX 4090 Founders Edition، حافظهٔ ۲۴ گیگابایت | دکتر اچپی؛ ۵۲۹٬۰۰۰٬۰۰۰ |
| پردازنده | AMD Ryzen 9 9950X Tray، ۱۶ هسته و ۳۲ رشته | گسترش سیستم؛ ۱۱۹٬۰۰۰٬۰۰۰ |
| مادربرد | Gigabyte X870 GAMING X WIFI7 | گسترش سیستم؛ ۶۱٬۲۰۰٬۰۰۰ |
| حافظهٔ میزبان | V-Color Manta XFinity RGB 64GB (2×32GB) DDR5-6000 CL30 U-DIMM، مشاهدهٔ ۲۸ شهریور ۱۴۰۵؛ موجود در انبار | لیون کامپیوتر؛ ۲۳۵٬۰۰۰٬۰۰۰ |
| ذخیرهسازی | Samsung 990 PRO NVMe، دو ترابایت | گسترش سیستم؛ ۸۴٬۷۰۰٬۰۰۰ |
| منبع تغذیه | Green GP1000B-EDGE، هزار وات | کامپیوتر پارسیان؛ ۴۹٬۴۰۰٬۰۰۰ |
| خنککنندهٔ پردازنده | DeepCool LT360 ARGB Black، رادیاتور ۳۶۰ میلیمتری | گسترش سیستم؛ ۲۱٬۹۰۰٬۰۰۰ |
| کیس و فنهای همراه | Green Z5، چهار فن | گسترش سیستم؛ ۱۵٬۹۰۰٬۰۰۰ |
| جمع قطعات | یک ایستگاه کاری با یک GPU | ۱٬۱۱۶٬۱۰۰٬۰۰۰ |
در این سبد، کارت ۴۷٫۴۰ درصد مبلغ خرید است و بقیهٔ قطعات ۵۸۷٫۱ میلیون تومان هزینه دارند. سهم RAM ۲۱٫۰۶ درصد است. کیت ۶۴ گیگابایتی V-Color از لیون، جای کیت G.Skill با قیمت ۴۰۰ میلیون تومانی تکاف را گرفته؛ این انتخابِ محصول دیگری است و جمع خرید را ۱۶۵٬۰۰۰٬۰۰۰ تومان پایین میآورد. قیمت سایر قطعات متعلق به ۲۵ شهریور است. با فرض تاریخیِ دلار ۲۳۰ هزار تومانی، جمع سبد معادل ۴٬۸۵۲٫۶۱ دلار میشود.
این نمونهٔ یک ایستگاه کاری دارای 4090 است؛ شروع کار محدود سازمانی الزاماً به چنین خریدی نیاز ندارد. قیمتها هم عرضههای مشخص همین فروشندگاناند. کیس ایستاده است و رادیاتور در جلو نصب میشود؛ برای استقرار در رک، شاسی و اجزای سکوی سرور GPU انتخاب متفاوتی میخواهد.
حالا ۱٫۱۱۶۱ میلیارد تومان خرید را در ۲۴ ماه سرشکن کنیم: ماهانه ۴۶٬۵۰۴٬۱۶۷ تومان، یعنی ۶٬۸۷۵٬۰۰۰ تومان کمتر از سبد قبلی. تعرفههای اجارهٔ ۲۵ شهریور را ثابت نگه میداریم و ارزش فروش دستدوم را از خرید کم نمیکنیم. اختلاف زیر، فضای باقیمانده برای برق، استقرار، نگهداری و تأمین سرمایه است:
| گزینهٔ اجاره برای مقایسه | پرداخت اجاره در ۲۴ ماه، تومان | فاصله با خرید قطعات، تومان | سقف متوسط هزینهٔ اضافهٔ مالکیت در ماه برای برابرشدن دو مسیر، تومان |
|---|---|---|---|
| ایرانسرور؛ 4090 Smart ماهانه | ۲٬۱۸۴٬۰۰۰٬۰۰۰ | ۱٬۰۶۷٬۹۰۰٬۰۰۰ | ۴۴٬۴۹۵٬۸۳۳ |
| ایرانسرور؛ Smart با پرداخت سالانه و ۱۰٪ تخفیف | ۱٬۹۶۵٬۶۰۰٬۰۰۰ | ۸۴۹٬۵۰۰٬۰۰۰ | ۳۵٬۳۹۵٬۸۳۳ |
| ابر فردوسی؛ یک 4090، ماهی ۷۲۰ ساعت | ۱٬۳۷۰٬۳۰۴٬۰۰۰ | ۲۵۴٬۲۰۴٬۰۰۰ | ۱۰٬۵۹۱٬۸۳۳ |
با تخفیف ۱۰درصدی پرداخت سالانهٔ ایرانسرور، هزینهٔ سال اول ۹۸۲٫۸ میلیون تومان میشود؛ ردیف دوساله تکرار همان تعرفه و تخفیف در سال دوم را فرض میکند. سقف هزینهٔ اضافهٔ مالکیت از ماهانه ۴۴٫۵۰ به ۳۵٫۴۰ میلیون تومان میرسد.
در قرارداد ماهانهٔ ایرانسرور، فاصلهٔ دوساله ۱٬۰۶۷٫۹ میلیون تومان است؛ در ردیف فردوسی ۲۵۴٫۲۰۴ میلیون تومان. برق، نگهداری و هزینهٔ سرمایه میتوانند این فاصله را پر کنند. توسعهٔ برنامه و نگهداری موتور هم در هر دو مسیر باقی میمانند.
منابع میزبان یکسان نیستند: سیستم خریدنی ۶۴ گیگابایت RAM و دو ترابایت SSD دارد، Smart ایرانسرور ۹۰ و ۷۰۰ گیگابایت و فردوسی ۱۶ و ۱۰۰ گیگابایت. اگر ۱۶ گیگابایت RAM برای بارگذاری مدل یا اجزای RAG کافی نباشد، پلن فردوسی مناسب همان کار نیست. در هر سه، حافظهٔ کارت ۲۴ گیگابایت است؛ نیاز به حافظهٔ ۴۸ گیگابایتی صورتحساب دیگری میسازد.
شدت استفاده نتیجه را بیشتر عوض میکند: با پنجاه ساعت کار در ماه، اجارهٔ فردوسی در دو سال ۹۵٬۱۶۰٬۰۰۰ تومان، حدود ۸٫۵ درصد خرید قطعات است. برای سرویس شبانهروزی، هزینهٔ استقرار و تأمین سرمایه را باید در فاصلهٔ خرید و اجاره جا داد؛ برای مصرف مقطعی، بخش زیادی از سرمایهٔ خرید بیشتر اوقات بیاستفاده میماند.
نقطهٔ سربهسر، یک عدد همیشگی نیست
اکنون میتوانیم یک مقایسهٔ همواحد انجام دهیم. هر فراخوانی کوتاه GPT-4.1 mini در مثال آروان ۳۵۳٫۲۸ تومان مصرف داشت. تقسیم اجارهٔ ماهانهٔ ۹۱ میلیون تومانی بر این عدد، حدود ۲۵۸ هزار فراخوانی در ماه میدهد. برای الگوی اسنادیِ همان مدل، این آستانه به حدود ۸۶ هزار فراخوانی میرسد؛ چون هزینهٔ هر فراخوانی اسنادی ۱٬۰۵۹٫۸۴ تومان است.
این دو عدد فقط محل برابرشدن مصرف مدل در API و اجارهٔ سرور هستند. مدل بازوزنِ قابلاجرا روی 4090 باید همان کار را با کیفیت فارسی لازم انجام دهد و ظرفیت تحویل آن تعداد پاسخ را نیز داشته باشد. قرار نیست نام دو مدل متفاوت را از صورتحساب حذف کنیم و فقط مبلغشان را مقایسه کنیم. نیروی نگهداری موتور، خطاها، پایگاه داده و ظرفیت پشتیبان نیز هنوز باید در هزینهٔ کل دیده شوند.
برای تیمی با مصرف کم، API میتواند حتی با هزینهٔ هر فراخوانی بیشتر، انتخاب اقتصادیتری باشد؛ چون سرور و نیروی عملیات را زودتر از نیاز درگیر نمیکند. برای خدمتی با بار ثابت، مدل کوچکِ مناسب و تیم باتجربه، اجرای داخلی ممکن است هزینهٔ هر پاسخ را پایین بیاورد. در ایران، نوسان نرخ تسویهٔ اعتبار API و قیمت تمدید اجاره نیز دو مسیر متفاوتِ تغییر بودجهاند؛ تعرفهٔ امروز را نباید برای سه سال ثابت فرض کرد.
پیش از خرید GPU گرانتر، اندازهٔ مسئله را کوچک کنیم
در ترکیب واقعی درخواستهای ترگمان، حدود ۳۰ درصد از سهم ترجمه مربوط به دیکشنری بود و اصلاً وارد مدل زبانی نمیشد. ترجمهٔ متنی، خلاصهسازی و چت نیز یک مدل مشترک داشتند. برای محاسبهٔ هزینه، این تفاوت خیلی مهم است: همهٔ درخواستهای سایت را نباید در قیمت تولید پاسخ با LLM ضرب کرد و برای هر خدمت هم الزاماً مدل جداگانهای در حافظه لازم نیست.
در یک شرکت ایرانی هم ممکن است بخش بزرگی از مراجعهها، پیدا کردن وضعیت سفارش، تاریخ مهلت یا بند مشخص یک دستورالعمل باشد. پاسخ قطعیِ قابلخواندن از سامانهٔ عملیاتی، نیازی به تولید دوباره با مدل ندارد. برای کارهایی که به فهم متن نیاز دارند، انتخاب اندازهٔ مدل بر اساس کاربرد میتواند هزینه را از مرحلهٔ طراحی پایین بیاورد. یک مدل هشتمیلیاردی که کار را درست انجام میدهد، از مدل بزرگتری که صرفاً روی کاغذ چشمگیر است ارزش بیشتری دارد.
کوانتیزهسازی، طول ورودی و موتور اجرا هم در هزینه دخیلاند. چهاربیتیکردن مدل میتواند نیاز حافظه را کم کند، اما قرار نیست سرعت و کیفیت را به نسبت ثابتی تغییر دهد. انتخاب Ollama، vLLM، SGLang یا llama.cpp نیز باید با تعداد کاربران و شیوهٔ سرویسدهی هماهنگ باشد. گاهی اصلاح صف، محدودکردن پاسخهای بیدلیل طولانی و آزادکردن درخواست لغوشده، پیش از خرید کارت بعدی جا برای خدمت بهتر باز میکند.
پایداری خدمت را در همان فاکتور حساب کنیم
«فروشندهٔ ایرانی» و «پردازش داخل ایران» دو مشخصهٔ جدا هستند. پرداخت ریالی و پشتیبانی فارسی مشکل خرید خدمت را آسانتر میکنند، اما برای مدلی که روی زیرساخت خارجی اجرا میشود، مسیر ارتباطی و وابستگی به ارائهدهندهٔ اصلی همچنان وجود دارد. حتی دو واسطهٔ متفاوت ممکن است در نهایت به یک مدل و زیرساخت بالادستی برسند. برای مسیر پشتیبان، تنوع نام تجاری کافی نیست.
در تجربهٔ ترگمان هنگام اختلال ارتباط خارجی، مدل روی سرورهای خودمان اجرا میشد و منابع داخلی در دسترس بودند. ادامهٔ خدمت در آن شرایط، بخشی از ارزش زیرساخت بود که در قیمت هر میلیون توکن دیده نمیشود. همان گزارش نشان میدهد وقتی یکی از دو سرور از مدار خارج شد، دیگری خدمت را ادامه داد، اما با انتظار بیشتر و ریزش بخشی از درخواستها. داشتن پشتیبان با حفظ کامل ظرفیت قبلی یکسان نیست.
در بودجهٔ سازمان، هزینهٔ توقف باید کنار هزینهٔ پردازش قرار بگیرد: معطلماندن کارشناس، پاسخنگرفتن مشتری، عقبافتادن پردازش اسناد و زمان بازیابی سرویس. برای دستیار داخلیِ کماهمیت شاید چند ساعت توقف قابل تحمل باشد؛ برای خدمتی که کار روزانه به آن وابسته است، ظرفیت باقیمانده پس از خرابی ارزش مالی دارد. روش طراحی آن در سرویسدهی سازمانی مدل زبانی آمده است.
محل پردازش داده هم انتخاب را محدود میکند. اگر قرارداد سازمان اجازهٔ خروج متن خام را نمیدهد، ارزانترین API بیرونی اصلاً گزینهٔ همارز نیست. در مقابل، مستقرکردن مدل در ایران بهتنهایی کنترل دسترسی، ثبت رویداد و جداسازی دادهها را تأمین نمیکند. این موضوع در محرمانگی داده و APIهای عمومی جداگانه بررسی شده است؛ هزینه باید میان گزینههایی مقایسه شود که واقعاً اجازهٔ استفاده از آنها را داریم.
چه ترکیبی برای چه وضعیتی مناسبتر است؟
| وضعیت | نقطهٔ شروع مناسب | چیزی که تصمیم را عوض میکند |
|---|---|---|
| محصول تازه با تقاضای نامعلوم | API مصرفی از عرضهکنندهٔ ایرانی | کیفیت فارسی، صورتحساب واقعی و وابستگی مسیر پاسخ |
| آزمودن مدل بازوزن یا یک پروژهٔ کوتاه | GPU ساعتی داخل ایران | حافظهٔ میزبان، مدت تخصیص و امکان آزادکردن منابع |
| سرویس شبانهروزی با مدل مشخص | مقایسهٔ اجارهٔ ماهانه با خرید کامل | ظرفیت در اوج، سرمایهٔ درگیر و نیروی عملیات |
| بار ثابت همراه با چند روز شلوغ | ظرفیت پایه و مسیر کمکیِ از قبل آزمایششده | دسترسی به ظرفیت اضافه در همان زمان نیاز |
| داده با محدودیت محل پردازش | استقرار در محیط مجاز سازمان | هزینهٔ امنیت، نگهداری و پشتیبان در همان محیط |
| کارهای سادهٔ زیاد و تحلیل دشوارِ کم | مدل کوچک برای بار اصلی و مسیر جدا برای موارد دشوار | کیفیت تشخیص و ارجاع موارد دشوار |
برای شروع، یک دورهٔ محدود با اسناد فارسی و بار واقعی از خرید زودهنگام سرور مفیدتر است. در پایان آن دوره باید بدانیم چه سهمی از درخواستها پذیرفته میشود، هر کار چند توکن و چند تلاش مصرف میکند، ساعت شلوغ چه ظرفیتی میخواهد و کدام وابستگی میتواند خدمت را متوقف کند. اینها دادههایی هستند که از رویشان میشود دربارهٔ خرید یا اجاره تصمیم گرفت.
برای بعضی تیمها، نتیجه همان API مصرفی است؛ برای بعضی دیگر، مدل کوچک روی GPU داخلی و یک مسیر کمکی برای کارهای دشوار. معیار من این است که پول صرف پاسخ قابل استفاده و خدمت قابل اتکا شود. ظرفیت گرانِ بیکار و توکن ارزانِ بینتیجه، هر دو میتوانند بودجه را هدر بدهند.
