برای یک شرکت ایرانی، انتخاب میان خرید سرور، اجارهٔ GPU و API از صورت‌حساب تومانی شروع می‌شود، اما به همان‌جا ختم نمی‌شود. تیم فنی می‌خواهد بداند مدل با متن فارسی و اسناد سازمان چه می‌کند؛ مدیر مالی باید هزینهٔ ماهانه و پولی را که در سخت‌افزار می‌خوابد ببیند؛ مدیر خدمت هم می‌پرسد اگر ارتباط خارجی مختل شد یا یک سرور از کار افتاد، پاسخ‌گویی چه می‌شود. تصمیم خوب باید به هر سه پرسش جواب بدهد.

فرض کنیم دستیار یک فروشگاه، شرکت بیمه یا واحد پشتیبانی را می‌سازیم: بخشی از درخواست‌ها کوتاه‌اند و بخشی به خواندن اسناد و سابقهٔ گفتگو نیاز دارند. می‌توانیم مصرف مدل را از یک عرضه‌کنندهٔ ایرانی API بخریم، مدل بازوزن را روی GPU اجاره‌ای اجرا کنیم یا زیرساخت خودمان را داشته باشیم. تفاوت اقتصادی این راه‌ها وقتی معلوم می‌شود که هزینهٔ انجام همان کار، با کیفیت فارسی و زمان پاسخ قابل‌قبول را کنار هم بگذاریم.

برای یکسان‌کردن مبنای مقایسه، ابتدا مدل متناسب با کاربرد و حافظه و سخت‌افزار لازم برای اجرای آن را مشخص کنید؛ اختلاف اندازهٔ مدل و تعداد درخواست‌های هم‌زمان می‌تواند هزینهٔ هر سه روش را تغییر دهد.

قیمت‌ها در ۲۵ شهریور ۱۴۰۵، برابر با ۱۶ سپتامبر ۲۰۲۶ از صفحات عرضه‌کنندگان گردآوری شده‌اند؛ فقط عرضهٔ RAM در ۲۸ شهریور، ۱۹ سپتامبر به‌روزرسانی شده است. مبنای تبدیل تعرفه‌های دلاری، دلار ۲۳۰ هزار تومانی است. قیمت دلارِ «الان»؟ الان یا الان؟ تا این جمله را بخوانید، شاید باید دوباره حساب کنیم! قیمت‌های عرضه فروشندگان بدون تبدیل مجدد ارایه شده‌اند؛ مالیات و هزینه‌هایی که جدا به فاکتور اضافه شوند، در جمع‌ها نیستند.

اول، واحد مقایسه را درست انتخاب کنیم

صد هزار درخواست، صد هزار کار انجام‌شده نیست. ممکن است پاسخ دستیار پشتیبانی نیاز به اصلاح داشته باشد، استخراج اطلاعات یک فاکتور دوباره اجرا شود یا عامل برنامه‌نویسی برای یک کار چند بار مدل را صدا بزند. معیار اقتصادی مفید، هزینهٔ هر کار پذیرفته‌شده است: کل هزینهٔ خدمت در ماه را بر تعداد کارهایی تقسیم کنیم که معیار کیفیت و زمان پاسخ را گذرانده‌اند. تلاش‌های ناموفق و زمان بازبینی هم هزینه دارند.

در فارسی، طول ظاهری متن معیار مطمئنی برای مصرف نیست. یک نامهٔ اداری با نیم‌فاصله، شمارهٔ پرونده و واژه‌های انگلیسی ممکن است در دو مدل تعداد توکن متفاوتی داشته باشد. برای مقایسهٔ کیفیت، نمونه‌هایی از کار واقعی لازم است؛ همان روشی که در سنجش مدل‌های زبانی برای فارسی توضیح داده شده است. برای برآورد مالی، گزارش مصرف همان مدل مبناست.

میانگین ماهانه هم جای اوج مراجعه را نمی‌گیرد. صد هزار پرسش پخش‌شده در ماه با هجوم مراجعه در روز ثبت‌نام یا پایان مهلت یک فراخوان، زیرساخت یکسانی نمی‌خواهد. هزینهٔ سرور از ظرفیت لازم در ساعت شلوغ تأثیر می‌گیرد، حتی اگر بیشتر روز بیکار بماند. این تفاوت در گذار از یک کاربر به سرویس سازمانی مهم می‌شود.

موضوع هزینهخرید و اجرای داخلیGPU اجاره‌ایAPI مصرفی
پرداخت شروعسیستم، نصب و آماده‌سازی محلآماده‌سازی محیط و مدلاتصال برنامه و شارژ اعتبار
پرداخت جاریمیزبانی، انرژی، نگهداری و هزینهٔ سرمایهزمان تخصیص سرور و خدمات همراهمصرف مدل و هزینهٔ ثابت احتمالی سرویس
در ساعت‌های خلوتسرمایه و هزینهٔ نگهداری باقی استماشین تخصیص‌یافته ممکن است همچنان هزینه داشته باشدمصرف مدل کم می‌شود
مسئول اجرای مدلتیم سازماندر اجارهٔ خام، تیم سازمانعرضه‌کنندهٔ مدل
برنامه و اسنادبر عهدهٔ سازمانبر عهدهٔ سازمانهمچنان بر عهدهٔ سازمان، مگر در محصول مدیریت‌شده
ادامهٔ کار هنگام خرابینیازمند ظرفیت جایگزینوابسته به طراحی و قراردادوابسته به مسیر جایگزین و ارائه‌دهندهٔ بالادستی

API ایرانی: قیمت توکن، تمام مبلغ پرداخت نیست

تعرفهٔ AIaaS آروان‌کلاد برای هر میلیون توکن ورودی و خروجی به تومان منتشر شده است. سه مدل زیر برای محاسبه انتخاب شده‌اند؛ این جدول مقایسهٔ قیمت مصرف است و دربارهٔ برتری کیفیت فارسی آن‌ها داوری نمی‌کند.

مدل در آروان‌کلادورودی، تومان برای یک میلیون توکنخروجی، تومان برای یک میلیون توکن
GPT-4o mini۳۳٬۱۲۰۱۳۲٬۴۸۰
GPT-4.1 mini۸۸٬۳۲۰۳۵۳٬۲۸۰
GPT-5 mini۵۵٬۲۰۰۴۴۱٬۶۰۰

برای مقایسه با فروشندگان دیگر، یک مدل مشترک را نگه داریم. در جدول عمومی گپ‌جی‌پی‌تی، صفحهٔ GPT-4.1 Mini در اول ای‌آی و فهرست مدل‌های لیارا، تعرفهٔ مصرف این مدل چنین است:

عرضه‌کنندهورودی GPT-4.1 Mini، دلار برای یک میلیون توکنخروجی GPT-4.1 Mini، دلار برای یک میلیون توکن
گپ‌جی‌پی‌تی0.401.60
اول ای‌آی0.401.60
لیارا0.401.60

با دلار ۲۳۰ هزار تومانی، تعرفهٔ این جدول معادل ۹۲ هزار تومان برای یک میلیون توکن ورودی و ۳۶۸ هزار تومان برای یک میلیون توکن خروجی است. این تبدیل محاسباتی است؛ عدد قابل پرداخت در پنل هر سرویس به نرخ تسویهٔ همان سرویس بستگی دارد.

قیمت توکن این سه ردیف برابر است، اما هزینهٔ کل الزاماً برابر نیست. در تعرفهٔ پلن‌های لیارا، میرزاخانی ماهانه ۶۰۰ هزار تومان و تورینگ ۱ میلیون و ۵۰ هزار تومان هزینهٔ جدا از توکن دارند. برای صد هزار فراخوانی کوتاه، با الگوی دو هزار توکن ورودی و پانصد توکن خروجی در هر فراخوانی، مصرف مدل ۱۶۰ دلار می‌شود: دویست میلیون توکن ورودی با نرخ ۰٫۴ دلار و پنجاه میلیون توکن خروجی با نرخ ۱٫۶ دلار. با نرخ تبدیل این یادداشت، حاصل ۳۶ میلیون و ۸۰۰ هزار تومان است؛ با افزودن پلن میرزاخانی، جمع این دو قلم ۳۷ میلیون و ۴۰۰ هزار تومان می‌شود. این مبلغ، برآورد همان دو قلم با نرخ تبدیل مشخص است و هزینهٔ سرور برنامه، مالیات یا دیگر اقلام احتمالی را شامل نمی‌شود.

جدول گپ‌جی‌پی‌تی مربوط به API توسعه‌دهندگان است. خرید اشتراک محیط گفتگو، بودجهٔ اتصال نرم‌افزار سازمانی محسوب نمی‌شود. در یک شرکت ممکن است کارکنان اشتراک چت داشته باشند و محصول شرکت نیز جداگانه از API استفاده کند؛ این دو هزینه باید در دو ردیف بودجه ثبت شوند.

برای دستیار اسناد نیز مصرف مدل پاسخ‌گو فقط بخشی از هزینه است. آروان برای پایگاه دانش، دیتابیس اختصاصی و مصرف embedding را جدا مطرح می‌کند. در پیاده‌سازی خودمان هم استخراج متن، نگهداری سند، جست‌وجو و کنترل دسترسی از صورت مسئله حذف نمی‌شوند؛ فقط شکل پرداختشان عوض می‌شود.

صد هزار درخواست در ماه چقدر هزینه دارد؟

دو الگوی مشخص را حساب کنیم. در پرسش کوتاه، هر فراخوانی دو هزار توکن ورودی و پانصد توکن خروجی دارد. در پرسش اسنادی، هشت هزار توکن ورودی و هزار توکن خروجی فرض شده است. تعداد فراخوانی و طول ورودی و خروجی، ورودی‌های انتخاب‌شده برای مقایسه‌اند؛ میانگین اندازه‌گیری‌شدهٔ یک سرویس فارسی نیستند. اعداد زیر برای صد هزار فراخوانی و بر اساس تعرفهٔ تومانی آروان محاسبه شده‌اند؛ کش، ابزارها و تلاش دوباره در این مثال نیستند. منظور از خروجی، تمام توکن‌های قابل‌صورتحساب است، نه صرفاً طول متن دیده‌شده توسط کاربر.

مدلصد هزار پرسش کوتاه، تومانصد هزار پرسش اسنادی، تومان
GPT-4o mini۱۳٬۲۴۸٬۰۰۰۳۹٬۷۴۴٬۰۰۰
GPT-4.1 mini۳۵٬۳۲۸٬۰۰۰۱۰۵٬۹۸۴٬۰۰۰
GPT-5 mini۳۳٬۱۲۰٬۰۰۰۸۸٬۳۲۰٬۰۰۰

برای نمونه، در الگوی کوتاه GPT-4.1 mini، دویست میلیون توکن ورودی و پنجاه میلیون توکن خروجی داریم. سهم هرکدام ۱۷٬۶۶۴٬۰۰۰ تومان می‌شود و جمع آن‌ها به حدود ۳۵٫۳ میلیون تومان می‌رسد. همین تعداد پرسش با ورودی اسنادی، حدود ۱۰۶ میلیون تومان مصرف دارد. در نتیجه، تعداد کاربران به‌تنهایی بودجه را توضیح نمی‌دهد؛ طول سابقهٔ گفتگو و متن اسنادی که به مدل می‌فرستیم هم تعیین‌کننده است.

این نکته برای دستیارهای فارسی سازمانی خیلی عملی است. اگر برای هر سوال، چندین صفحه بخشنامهٔ کم‌ارتباط یا تمام تاریخچهٔ گفتگو را دوباره بفرستیم، هزینهٔ ورودی را بالا برده‌ایم، بدون اینکه لزوماً جواب بهتر شده باشد. انتخاب درست embedding و reranker می‌تواند به رساندن قطعات مرتبط‌تر کمک کند. در عامل برنامه‌نویسی نیز یک درخواست کاربر ممکن است چندین رفت‌وبرگشت داشته باشد؛ بودجهٔ آن با یک پاسخ کوتاه قابل مقایسه نیست.

برای تصمیم نهایی، هزینهٔ ثبت‌شده در صورتحساب را بر تعداد کارهای پذیرفته‌شده در آزمون همان سرویس تقسیم می‌کنیم. بدون اندازه‌گیری کیفیت فارسی و تعداد تلاش‌ها، نمی‌توان از جدول قیمت توکن نتیجه گرفت کدام گزینه ارزان‌ترین پاسخ قابل استفاده را تحویل می‌دهد.

اجارهٔ GPU: ساعت روشن‌بودن را می‌خریم

برای مقایسهٔ هزینهٔ اجاره در ایران، چند پلن از ایران‌سرور، از شرکت‌های گروه گرین‌وب، و ابر فردوسی در کنار هم قرار گرفته‌اند. قیمت‌ها متعلق به پیکربندی کامل همان ردیف هستند؛ برابر بودن نام کارت به معنی برابر بودن RAM، CPU یا فضای ذخیره‌سازی نیست.

عرضه‌کننده و پلنGPU و منابع همراهشیوهٔ پرداختقیمت اعلام‌شده، تومان
ایران‌سرور، RTX3090-Startحافظهٔ GPU: ۲۴؛ CPU: ۱۶ هسته؛ RAM: ۳۰؛ SSD: ۳۳۰ گیگابایتماهانه۴۰٬۵۰۰٬۰۰۰
ایران‌سرور، RTX4090-Smartحافظهٔ GPU: ۲۴؛ CPU: ۳۲ هسته؛ RAM: ۹۰؛ SSD: ۷۰۰ گیگابایتماهانه۹۱٬۰۰۰٬۰۰۰
ایران‌سرور، A6000-Lightحافظهٔ GPU: ۴۸؛ CPU: ۱۶ هسته؛ RAM: ۶۰؛ SSD: ۷۰۰ گیگابایتماهانه۱۱۷٬۰۰۰٬۰۰۰
ایران‌سرور، RTX4090-Smartهمان پیکربندی ردیف ماهانهساعتی۱۸۹٬۰۰۰
ابر فردوسی، GPU-4090-8c-16r-100d-x1یک RTX 4090 با ۲۴ گیگابایت؛ CPU: ۸ هستهٔ مجازی؛ RAM: ۱۶؛ دیسک: ۱۰۰ گیگابایتساعتی۷۹٬۳۰۰

پلن‌های 3090 و 4090 جدول ایران‌سرور در شیراز و A6000 در تبریز معرفی شده‌اند؛ هر سه یک ترابایت ترافیک دارند. ابر فردوسی نیز سرویس GPU را روی زیرساخت داخل ایران عرضه می‌کند. محدودیت RAM در ردیف ارزان‌تر فردوسی مهم است: برای بعضی مدل‌ها، بارگذاری وزن‌ها، تبدیل قالب یا اجرای اجزای RAG به حافظهٔ میزبان بیشتری نیاز دارد. بررسی حافظه و سخت‌افزار راهنمای مدل‌های زبانی کمک می‌کند چنین تفاوتی پشت نام 4090 پنهان نماند.

ساعتی‌بودن وقتی ارزش دارد که کار واقعاً مقطعی باشد. برای نمونهٔ محاسباتیِ پنجاه ساعت تخصیص منابع، ضرب تعرفهٔ ساعتی در پنجاه، برای پلن فردوسی ۳٬۹۶۵٬۰۰۰ تومان و برای پلن Smart ایران‌سرور ۹٬۴۵۰٬۰۰۰ تومان می‌شود. برای یک دورهٔ سی‌روزه، یعنی ۷۲۰ ساعت، همان Smart با نرخ ساعتی ۱۳۶٬۰۸۰٬۰۰۰ تومان هزینه دارد؛ در حالی که بستهٔ ماهانه‌اش ۹۱ میلیون تومان اعلام شده است. تقسیم ۹۱ میلیون بر ۱۸۹ هزار، برابری حسابی دو روش پرداخت را در حدود ۴۸۱٫۵ ساعت نشان می‌دهد. طول دوره و شرایط بستهٔ ماهانه نیز باید با دورهٔ استفاده منطبق باشد؛ ۷۲۰ ساعت برای همین مثال سی‌روزه در نظر گرفته شده است.

در مورد فردوسی، ضرب سادهٔ ۷۹٬۳۰۰ در ۷۲۰، ۵۷٬۰۹۶٬۰۰۰ تومان می‌شود؛ این عدد معادل استفادهٔ پیوسته با نرخ ساعتی است، نه تعرفهٔ یک بستهٔ ماهانه. خاموش‌کردن پردازش مدل داخل سیستم‌عامل نیز لزوماً منابع اجاره‌ای را آزاد نمی‌کند. برای یک پروژهٔ سه‌روزه، زمان دانلود وزن‌ها، آماده‌سازی و اجرای ناموفق هم ممکن است بخشی از زمان تخصیص ماشین باشد.

اجاره یک مزیت دیگر هم دارد: پیش از خواباندن سرمایه در خرید، می‌توانیم نسخهٔ مدل و الگوی بار واقعی را روی سخت‌افزار امتحان کنیم. خروجی این دوره باید روشن کند چند پاسخ قابل‌قبول در ساعت شلوغ تحویل می‌گیریم و حافظه کجا کم می‌آید. یک ماه اجاره که جلوی خرید پیکربندی نامناسب را بگیرد، صرفاً «هزینهٔ اضافه» نیست.

خرید: قیمت کارت را با قیمت خدمت اشتباه نگیریم

برای خرید، یک ایستگاه کاری تک‌کارت را حساب کنیم: RTX 4090 با ۲۴ گیگابایت حافظه، پردازندهٔ شانزده‌هسته‌ای Ryzen 9، رم ۶۴ گیگابایتی و SSD دوترابایتی. این ترکیب برای اجرای مدل و پردازش اسناد در نظر گرفته شده است؛ CPU و RAM میزبان باید بار آماده‌سازی داده و اجزای RAG را هم تحمل کنند. قیمت هر قلم، همان مبلغ درج‌شده در صفحهٔ فروشنده در روز بررسی است:

قطعهمدل و پیکربندیفروشنده و قیمت، تومان
کارت گرافیکNVIDIA RTX 4090 Founders Edition، حافظهٔ ۲۴ گیگابایتدکتر اچ‌پی؛ ۵۲۹٬۰۰۰٬۰۰۰
پردازندهAMD Ryzen 9 9950X Tray، ۱۶ هسته و ۳۲ رشتهگسترش سیستم؛ ۱۱۹٬۰۰۰٬۰۰۰
مادربردGigabyte X870 GAMING X WIFI7گسترش سیستم؛ ۶۱٬۲۰۰٬۰۰۰
حافظهٔ میزبانV-Color Manta XFinity RGB 64GB (2×32GB) DDR5-6000 CL30 U-DIMM، مشاهدهٔ ۲۸ شهریور ۱۴۰۵؛ موجود در انبارلیون کامپیوتر؛ ۲۳۵٬۰۰۰٬۰۰۰
ذخیره‌سازیSamsung 990 PRO NVMe، دو ترابایتگسترش سیستم؛ ۸۴٬۷۰۰٬۰۰۰
منبع تغذیهGreen GP1000B-EDGE، هزار واتکامپیوتر پارسیان؛ ۴۹٬۴۰۰٬۰۰۰
خنک‌کنندهٔ پردازندهDeepCool LT360 ARGB Black، رادیاتور ۳۶۰ میلی‌متریگسترش سیستم؛ ۲۱٬۹۰۰٬۰۰۰
کیس و فن‌های همراهGreen Z5، چهار فنگسترش سیستم؛ ۱۵٬۹۰۰٬۰۰۰
جمع قطعاتیک ایستگاه کاری با یک GPU۱٬۱۱۶٬۱۰۰٬۰۰۰

در این سبد، کارت ۴۷٫۴۰ درصد مبلغ خرید است و بقیهٔ قطعات ۵۸۷٫۱ میلیون تومان هزینه دارند. سهم RAM ۲۱٫۰۶ درصد است. کیت ۶۴ گیگابایتی V-Color از لیون، جای کیت G.Skill با قیمت ۴۰۰ میلیون تومانی تکاف را گرفته؛ این انتخابِ محصول دیگری است و جمع خرید را ۱۶۵٬۰۰۰٬۰۰۰ تومان پایین می‌آورد. قیمت سایر قطعات متعلق به ۲۵ شهریور است. با فرض تاریخیِ دلار ۲۳۰ هزار تومانی، جمع سبد معادل ۴٬۸۵۲٫۶۱ دلار می‌شود.

این نمونهٔ یک ایستگاه کاری دارای 4090 است؛ شروع کار محدود سازمانی الزاماً به چنین خریدی نیاز ندارد. قیمت‌ها هم عرضه‌های مشخص همین فروشندگان‌اند. کیس ایستاده است و رادیاتور در جلو نصب می‌شود؛ برای استقرار در رک، شاسی و اجزای سکوی سرور GPU انتخاب متفاوتی می‌خواهد.

حالا ۱٫۱۱۶۱ میلیارد تومان خرید را در ۲۴ ماه سرشکن کنیم: ماهانه ۴۶٬۵۰۴٬۱۶۷ تومان، یعنی ۶٬۸۷۵٬۰۰۰ تومان کمتر از سبد قبلی. تعرفه‌های اجارهٔ ۲۵ شهریور را ثابت نگه می‌داریم و ارزش فروش دست‌دوم را از خرید کم نمی‌کنیم. اختلاف زیر، فضای باقی‌مانده برای برق، استقرار، نگهداری و تأمین سرمایه است:

گزینهٔ اجاره برای مقایسهپرداخت اجاره در ۲۴ ماه، تومانفاصله با خرید قطعات، تومانسقف متوسط هزینهٔ اضافهٔ مالکیت در ماه برای برابرشدن دو مسیر، تومان
ایران‌سرور؛ 4090 Smart ماهانه۲٬۱۸۴٬۰۰۰٬۰۰۰۱٬۰۶۷٬۹۰۰٬۰۰۰۴۴٬۴۹۵٬۸۳۳
ایران‌سرور؛ Smart با پرداخت سالانه و ۱۰٪ تخفیف۱٬۹۶۵٬۶۰۰٬۰۰۰۸۴۹٬۵۰۰٬۰۰۰۳۵٬۳۹۵٬۸۳۳
ابر فردوسی؛ یک 4090، ماهی ۷۲۰ ساعت۱٬۳۷۰٬۳۰۴٬۰۰۰۲۵۴٬۲۰۴٬۰۰۰۱۰٬۵۹۱٬۸۳۳

با تخفیف ۱۰درصدی پرداخت سالانهٔ ایران‌سرور، هزینهٔ سال اول ۹۸۲٫۸ میلیون تومان می‌شود؛ ردیف دوساله تکرار همان تعرفه و تخفیف در سال دوم را فرض می‌کند. سقف هزینهٔ اضافهٔ مالکیت از ماهانه ۴۴٫۵۰ به ۳۵٫۴۰ میلیون تومان می‌رسد.

در قرارداد ماهانهٔ ایران‌سرور، فاصلهٔ دوساله ۱٬۰۶۷٫۹ میلیون تومان است؛ در ردیف فردوسی ۲۵۴٫۲۰۴ میلیون تومان. برق، نگهداری و هزینهٔ سرمایه می‌توانند این فاصله را پر کنند. توسعهٔ برنامه و نگهداری موتور هم در هر دو مسیر باقی می‌مانند.

منابع میزبان یکسان نیستند: سیستم خریدنی ۶۴ گیگابایت RAM و دو ترابایت SSD دارد، Smart ایران‌سرور ۹۰ و ۷۰۰ گیگابایت و فردوسی ۱۶ و ۱۰۰ گیگابایت. اگر ۱۶ گیگابایت RAM برای بارگذاری مدل یا اجزای RAG کافی نباشد، پلن فردوسی مناسب همان کار نیست. در هر سه، حافظهٔ کارت ۲۴ گیگابایت است؛ نیاز به حافظهٔ ۴۸ گیگابایتی صورت‌حساب دیگری می‌سازد.

شدت استفاده نتیجه را بیشتر عوض می‌کند: با پنجاه ساعت کار در ماه، اجارهٔ فردوسی در دو سال ۹۵٬۱۶۰٬۰۰۰ تومان، حدود ۸٫۵ درصد خرید قطعات است. برای سرویس شبانه‌روزی، هزینهٔ استقرار و تأمین سرمایه را باید در فاصلهٔ خرید و اجاره جا داد؛ برای مصرف مقطعی، بخش زیادی از سرمایهٔ خرید بیشتر اوقات بی‌استفاده می‌ماند.

نقطهٔ سربه‌سر، یک عدد همیشگی نیست

اکنون می‌توانیم یک مقایسهٔ هم‌واحد انجام دهیم. هر فراخوانی کوتاه GPT-4.1 mini در مثال آروان ۳۵۳٫۲۸ تومان مصرف داشت. تقسیم اجارهٔ ماهانهٔ ۹۱ میلیون تومانی بر این عدد، حدود ۲۵۸ هزار فراخوانی در ماه می‌دهد. برای الگوی اسنادیِ همان مدل، این آستانه به حدود ۸۶ هزار فراخوانی می‌رسد؛ چون هزینهٔ هر فراخوانی اسنادی ۱٬۰۵۹٫۸۴ تومان است.

این دو عدد فقط محل برابرشدن مصرف مدل در API و اجارهٔ سرور هستند. مدل بازوزنِ قابل‌اجرا روی 4090 باید همان کار را با کیفیت فارسی لازم انجام دهد و ظرفیت تحویل آن تعداد پاسخ را نیز داشته باشد. قرار نیست نام دو مدل متفاوت را از صورت‌حساب حذف کنیم و فقط مبلغشان را مقایسه کنیم. نیروی نگهداری موتور، خطاها، پایگاه داده و ظرفیت پشتیبان نیز هنوز باید در هزینهٔ کل دیده شوند.

برای تیمی با مصرف کم، API می‌تواند حتی با هزینهٔ هر فراخوانی بیشتر، انتخاب اقتصادی‌تری باشد؛ چون سرور و نیروی عملیات را زودتر از نیاز درگیر نمی‌کند. برای خدمتی با بار ثابت، مدل کوچکِ مناسب و تیم باتجربه، اجرای داخلی ممکن است هزینهٔ هر پاسخ را پایین بیاورد. در ایران، نوسان نرخ تسویهٔ اعتبار API و قیمت تمدید اجاره نیز دو مسیر متفاوتِ تغییر بودجه‌اند؛ تعرفهٔ امروز را نباید برای سه سال ثابت فرض کرد.

پیش از خرید GPU گران‌تر، اندازهٔ مسئله را کوچک کنیم

در ترکیب واقعی درخواست‌های ترگمان، حدود ۳۰ درصد از سهم ترجمه مربوط به دیکشنری بود و اصلاً وارد مدل زبانی نمی‌شد. ترجمهٔ متنی، خلاصه‌سازی و چت نیز یک مدل مشترک داشتند. برای محاسبهٔ هزینه، این تفاوت خیلی مهم است: همهٔ درخواست‌های سایت را نباید در قیمت تولید پاسخ با LLM ضرب کرد و برای هر خدمت هم الزاماً مدل جداگانه‌ای در حافظه لازم نیست.

در یک شرکت ایرانی هم ممکن است بخش بزرگی از مراجعه‌ها، پیدا کردن وضعیت سفارش، تاریخ مهلت یا بند مشخص یک دستورالعمل باشد. پاسخ قطعیِ قابل‌خواندن از سامانهٔ عملیاتی، نیازی به تولید دوباره با مدل ندارد. برای کارهایی که به فهم متن نیاز دارند، انتخاب اندازهٔ مدل بر اساس کاربرد می‌تواند هزینه را از مرحلهٔ طراحی پایین بیاورد. یک مدل هشت‌میلیاردی که کار را درست انجام می‌دهد، از مدل بزرگ‌تری که صرفاً روی کاغذ چشمگیر است ارزش بیشتری دارد.

کوانتیزه‌سازی، طول ورودی و موتور اجرا هم در هزینه دخیل‌اند. چهاربیتی‌کردن مدل می‌تواند نیاز حافظه را کم کند، اما قرار نیست سرعت و کیفیت را به نسبت ثابتی تغییر دهد. انتخاب Ollama، vLLM، SGLang یا llama.cpp نیز باید با تعداد کاربران و شیوهٔ سرویس‌دهی هماهنگ باشد. گاهی اصلاح صف، محدودکردن پاسخ‌های بی‌دلیل طولانی و آزادکردن درخواست لغوشده، پیش از خرید کارت بعدی جا برای خدمت بهتر باز می‌کند.

پایداری خدمت را در همان فاکتور حساب کنیم

«فروشندهٔ ایرانی» و «پردازش داخل ایران» دو مشخصهٔ جدا هستند. پرداخت ریالی و پشتیبانی فارسی مشکل خرید خدمت را آسان‌تر می‌کنند، اما برای مدلی که روی زیرساخت خارجی اجرا می‌شود، مسیر ارتباطی و وابستگی به ارائه‌دهندهٔ اصلی همچنان وجود دارد. حتی دو واسطهٔ متفاوت ممکن است در نهایت به یک مدل و زیرساخت بالادستی برسند. برای مسیر پشتیبان، تنوع نام تجاری کافی نیست.

در تجربهٔ ترگمان هنگام اختلال ارتباط خارجی، مدل روی سرورهای خودمان اجرا می‌شد و منابع داخلی در دسترس بودند. ادامهٔ خدمت در آن شرایط، بخشی از ارزش زیرساخت بود که در قیمت هر میلیون توکن دیده نمی‌شود. همان گزارش نشان می‌دهد وقتی یکی از دو سرور از مدار خارج شد، دیگری خدمت را ادامه داد، اما با انتظار بیشتر و ریزش بخشی از درخواست‌ها. داشتن پشتیبان با حفظ کامل ظرفیت قبلی یکسان نیست.

در بودجهٔ سازمان، هزینهٔ توقف باید کنار هزینهٔ پردازش قرار بگیرد: معطل‌ماندن کارشناس، پاسخ‌نگرفتن مشتری، عقب‌افتادن پردازش اسناد و زمان بازیابی سرویس. برای دستیار داخلیِ کم‌اهمیت شاید چند ساعت توقف قابل تحمل باشد؛ برای خدمتی که کار روزانه به آن وابسته است، ظرفیت باقی‌مانده پس از خرابی ارزش مالی دارد. روش طراحی آن در سرویس‌دهی سازمانی مدل زبانی آمده است.

محل پردازش داده هم انتخاب را محدود می‌کند. اگر قرارداد سازمان اجازهٔ خروج متن خام را نمی‌دهد، ارزان‌ترین API بیرونی اصلاً گزینهٔ هم‌ارز نیست. در مقابل، مستقرکردن مدل در ایران به‌تنهایی کنترل دسترسی، ثبت رویداد و جداسازی داده‌ها را تأمین نمی‌کند. این موضوع در محرمانگی داده و APIهای عمومی جداگانه بررسی شده است؛ هزینه باید میان گزینه‌هایی مقایسه شود که واقعاً اجازهٔ استفاده از آن‌ها را داریم.

چه ترکیبی برای چه وضعیتی مناسب‌تر است؟

وضعیتنقطهٔ شروع مناسبچیزی که تصمیم را عوض می‌کند
محصول تازه با تقاضای نامعلومAPI مصرفی از عرضه‌کنندهٔ ایرانیکیفیت فارسی، صورتحساب واقعی و وابستگی مسیر پاسخ
آزمودن مدل بازوزن یا یک پروژهٔ کوتاهGPU ساعتی داخل ایرانحافظهٔ میزبان، مدت تخصیص و امکان آزادکردن منابع
سرویس شبانه‌روزی با مدل مشخصمقایسهٔ اجارهٔ ماهانه با خرید کاملظرفیت در اوج، سرمایهٔ درگیر و نیروی عملیات
بار ثابت همراه با چند روز شلوغظرفیت پایه و مسیر کمکیِ از قبل آزمایش‌شدهدسترسی به ظرفیت اضافه در همان زمان نیاز
داده با محدودیت محل پردازشاستقرار در محیط مجاز سازمانهزینهٔ امنیت، نگهداری و پشتیبان در همان محیط
کارهای سادهٔ زیاد و تحلیل دشوارِ کممدل کوچک برای بار اصلی و مسیر جدا برای موارد دشوارکیفیت تشخیص و ارجاع موارد دشوار

برای شروع، یک دورهٔ محدود با اسناد فارسی و بار واقعی از خرید زودهنگام سرور مفیدتر است. در پایان آن دوره باید بدانیم چه سهمی از درخواست‌ها پذیرفته می‌شود، هر کار چند توکن و چند تلاش مصرف می‌کند، ساعت شلوغ چه ظرفیتی می‌خواهد و کدام وابستگی می‌تواند خدمت را متوقف کند. این‌ها داده‌هایی هستند که از رویشان می‌شود دربارهٔ خرید یا اجاره تصمیم گرفت.

برای بعضی تیم‌ها، نتیجه همان API مصرفی است؛ برای بعضی دیگر، مدل کوچک روی GPU داخلی و یک مسیر کمکی برای کارهای دشوار. معیار من این است که پول صرف پاسخ قابل استفاده و خدمت قابل اتکا شود. ظرفیت گرانِ بیکار و توکن ارزانِ بی‌نتیجه، هر دو می‌توانند بودجه را هدر بدهند.