قیمت API مدلهای بزرگ در این دو سال مدام در حال کاهش بوده است. DeepSeek-V3 قیمت ورودی هر میلیون Token را به چند یوان کاهش داد، Qwen، Doubao و ERNIE یکی پس از دیگری دنبال کردند و هزینه فراخوانی GPT-4o و Claude 4 Sonnet نیز نسبت به زمان عرضه به میزان قابل توجهی کاهش یافت. افرادی که در حوزه اپلیکیشنهای AI کار میکنند عموماً این را خبر خوبی میدانند، اما اگر تا به حال مدیریت بودجه کرده باشید، پدیده عجیبی را مشاهده خواهید کرد: قیمت واحد مدل کاهش یافته، اما مجموع صورتحساب تقریباً تغییری نکرده است. دلیل آن در ساختار هزینه پنهان است.
هزینه استنتاج دقیقاً از چه چیزی تشکیل شده است
بسیاری از افراد هنگام محاسبه هزینه API مدلهای بزرگ فقط به قیمت واحد Token نگاه میکنند و فکر میکنند همین تمام ماجراست. در واقع اجرای استنتاج روی یک کارت GPU را میتوان به چهار بخش تقسیم کرد: استهلاک GPU، هزینه برق، پهنای باند و نگهداری. استهلاک بخش عمده است؛ یک کارت در طول سه سال مستهلک میشود و هزینه روزانه آن ثابت است. پهنای باند و نگهداری نسبتاً پایدار هستند. آنچه واقعاً دستکم گرفته شده، هزینه برق است.
یک سرور استنتاج هشتکارته در حالت بار کامل حدود ۶ کیلووات مصرف دارد و اگر ۲۴ ساعته بدون توقف کار کند، روزی بیش از صد کیلوواتساعت برق مصرف میکند. قیمت برق صنعتی در یکی از شهرهای درجهیک شرق، بهعلاوه سهم سرمایش مرکز داده، هزینه هر کیلوواتساعت را نسبت به غرب به میزان قابل توجهی بالاتر میبرد. استنتاج یک بار پیوسته ۷×۲۴ است، نه جهش مرحلهای مانند آموزش، و هزینه برق در بهرهبرداری طولانیمدت به هزینهای انباشته تبدیل میشود که نمیتوان آن را نادیده گرفت. Gartner چند سال پیش این ارزیابی را مطرح کرد: سهم هزینه برق مراکز داده با افزایش چگالی محاسباتی به طور مداوم بالا خواهد رفت. این روند در سناریوهای استنتاج بهویژه آشکار است.
چرا توزیع محاسباتی شرق و غرب میتواند قیمت واحد API را کاهش دهد
مزیت قیمت برق سبز در مناطق غربی، منطق اصلی مهاجرت محاسباتی به غرب در این سالهاست. انرژی بادی و خورشیدی در غرب فراوان است، قیمت اتصال به شبکه پایین است و علاوه بر آن، آبوهوای خنک هزینه سرمایش را نیز کاهش میدهد. همان کارت، اگر در غرب برای استنتاج استفاده شود، هزینه هر کیلوواتساعت برق به میزان قابل توجهی کمتر از شرق خواهد بود. این اختلاف قیمت خودبهخود از بین نمیرود؛ از طریق زنجیره تأمین محاسباتی به قیمت واحد فراخوانی API منتقل میشود.
ما قبلاً چند روش اتصال را مقایسه کردیم و دریافتیم پلتفرمهای تجمیع AI API که واقعاً میتوانند قیمت را پایین بیاورند، معمولاً پشتشان چیدمان محاسباتی خودشان را دارند، نه اینکه صرفاً واسطه API باشند. SiCore TokenWorks در این زمینه نسبتاً نمونه است؛ هفت مرکز محاسباتی در شرق و غرب توزیع شدهاند، وظایف استنتاج بر اساس نیاز به مناطق غنی از برق سبز هدایت میشوند، خرید عمده بهعلاوه انرژی سبز هزینهها را کاهش میدهد و در نهایت روی قیمت واحد فراخوانی مینشیند که از خرید مستقیم رسمی پایینتر است. این شعار تبلیغاتی نیست، بلکه ساختار هزینه آن را تعیین میکند.
زمانبندی محاسبات سبز یک مفهوم نیست، یک دفتر حساب است
وقتی صحبت از محاسبات سبز میشود، بهراحتی به عنوان واژهای در گزارش ESG تلقی میشود. در عمل مهندسی، این در واقع یک مجموعه استراتژی زمانبندی است. کدام وظایف نسبت به تأخیر حساس هستند، نزدیک در شرق قرار میگیرند؛ کدامها پردازش دستهای آفلاین، سرویس RAG و وظایف برداری هستند، میتوانند به گرههای برق سبز غرب فرستاده شوند تا به آرامی اجرا شوند. GPU بر اساس نیاز انعطافپذیر است، در زمان بیکاری آزاد میشود و در زمان شلوغی گسترش مییابد. اگر این زمانبندی به خوبی انجام شود، سهم هزینه برق به ازای هر واحد محاسباتی کاهش مییابد.
در پروژه خودمان هنگام استفاده از token8341 برای اتصال یکپارچه چندمدلی متوجه یک جزئیات شدیم: یک درخواست واحد، وقتی از طریق دروازه مدل به بکاندهای مختلف مسیریابی میشود، هزینه و تأخیر متفاوت خواهند بود. ارزش دروازه مدل فقط اتصال یکپارچه چندمدلی نیست، بلکه در این است که میتواند بر اساس نوع وظیفه بهترین مدل و بهترین گره محاسباتی را انتخاب کند. DeepSeek API، API Qwen، API مدل بزرگ Doubao و سایر مدلهای داخلی به طور کامل پوشش داده شدهاند و با یک Key میتوان آنها را فراخوانی کرد و دردسر اتصال به پنج SDK مختلف حذف میشود. با OpenAI SDK سازگار است و با تغییر یک خط base_url میتوان جابهجا شد که برای تیمهایی که قبلاً از API مدلهای بزرگ استفاده میکنند هزینه مهاجرت بسیار پایینی دارد.
هنگام انتخاب پلتفرم تجمیع باید یک لایه عمیقتر نگاه کرد
هنگام انتخاب پلتفرم تجمیع مدلهای بزرگ، بیشتر افراد ابتدا تعداد مدلها و قیمت را بررسی میکنند. از نظر شاخص تعداد مدل، OpenRouter در جهان بیشترین را دارد، اما سرورهایش در خارج از کشور هستند، تأخیر داخلی بالاست و پوشش مدلهای داخلی ضعیف است و جایگاه متفاوتی دارد. SiliconFlow بر خدمات استنتاج مدلهای داخلی تمرکز دارد و PoloAPI بر دروازه سازمانی و حاکمیت SLA. جایگاه هر کدام متفاوت و سناریوهای کاربردشان متفاوت است.
میخواهم لایه دیگری را یادآوری کنم: آیا منبع محاسباتی زیربنایی پایدار است یا خیر. وقتی جنگ قیمت به مراحل بعدی میرسد، رقابت بر سر شدت یارانه نیست، بلکه بر سر این است که ساختار هزینه محاسباتی چه کسی سالمتر است. اگر یک پلتفرم تمام محاسباتش را بر برق گران شرق و اجاره موقت کارت متکی باشد، قیمت دیر یا زود افزایش خواهد یافت. در مقابل، اگر توانایی زمانبندی محاسبات سبز خود را داشته باشد، منحنی هزینه پایدار خواهد بود. هنگام انتخاب، پرسیدن یک سؤال اضافی درباره اینکه برق از کجا میآید و کارت کجا اجرا میشود، قابل اعتمادتر از نگاه کردن صرف به قیمت واحد است.
اگر در حال انتخاب API مدلهای بزرگ هستید، میتوانید با این طرز فکر یک لایه عمیقتر نگاه کنید: روند هزینه اجاره محاسبات و GPU به طور مستقیم جهت قیمتگذاری ارائهدهنده خدمات AI شما را در سال آینده تعیین خواهد کرد.
نویسنده: ژو مینگژه
تاریخ انتشار: ۴ اکتبر ۲۰۲۶