SiCore TokenWorks
LLM APIAPI GatewayAggregation

مشاهده سی‌کاربون فاز گذار: پشت کاهش قیمت API مدل‌های بزرگ، حساب برق نادیده‌گرفته‌شده

SiCore TokenWorks Team·2026-10-03

قیمت API مدل‌های بزرگ در این دو سال مدام در حال کاهش بوده است. DeepSeek-V3 قیمت ورودی هر میلیون Token را به چند یوان کاهش داد، Qwen، Doubao و ERNIE یکی پس از دیگری دنبال کردند و هزینه فراخوانی GPT-4o و Claude 4 Sonnet نیز نسبت به زمان عرضه به میزان قابل توجهی کاهش یافت. افرادی که در حوزه اپلیکیشن‌های AI کار می‌کنند عموماً این را خبر خوبی می‌دانند، اما اگر تا به حال مدیریت بودجه کرده باشید، پدیده عجیبی را مشاهده خواهید کرد: قیمت واحد مدل کاهش یافته، اما مجموع صورتحساب تقریباً تغییری نکرده است. دلیل آن در ساختار هزینه پنهان است.

هزینه استنتاج دقیقاً از چه چیزی تشکیل شده است

بسیاری از افراد هنگام محاسبه هزینه API مدل‌های بزرگ فقط به قیمت واحد Token نگاه می‌کنند و فکر می‌کنند همین تمام ماجراست. در واقع اجرای استنتاج روی یک کارت GPU را می‌توان به چهار بخش تقسیم کرد: استهلاک GPU، هزینه برق، پهنای باند و نگهداری. استهلاک بخش عمده است؛ یک کارت در طول سه سال مستهلک می‌شود و هزینه روزانه آن ثابت است. پهنای باند و نگهداری نسبتاً پایدار هستند. آنچه واقعاً دست‌کم گرفته شده، هزینه برق است.

یک سرور استنتاج هشت‌کارته در حالت بار کامل حدود ۶ کیلووات مصرف دارد و اگر ۲۴ ساعته بدون توقف کار کند، روزی بیش از صد کیلووات‌ساعت برق مصرف می‌کند. قیمت برق صنعتی در یکی از شهرهای درجه‌یک شرق، به‌علاوه سهم سرمایش مرکز داده، هزینه هر کیلووات‌ساعت را نسبت به غرب به میزان قابل توجهی بالاتر می‌برد. استنتاج یک بار پیوسته ۷×۲۴ است، نه جهش مرحله‌ای مانند آموزش، و هزینه برق در بهره‌برداری طولانی‌مدت به هزینه‌ای انباشته تبدیل می‌شود که نمی‌توان آن را نادیده گرفت. Gartner چند سال پیش این ارزیابی را مطرح کرد: سهم هزینه برق مراکز داده با افزایش چگالی محاسباتی به طور مداوم بالا خواهد رفت. این روند در سناریوهای استنتاج به‌ویژه آشکار است.

چرا توزیع محاسباتی شرق و غرب می‌تواند قیمت واحد API را کاهش دهد

مزیت قیمت برق سبز در مناطق غربی، منطق اصلی مهاجرت محاسباتی به غرب در این سال‌هاست. انرژی بادی و خورشیدی در غرب فراوان است، قیمت اتصال به شبکه پایین است و علاوه بر آن، آب‌وهوای خنک هزینه سرمایش را نیز کاهش می‌دهد. همان کارت، اگر در غرب برای استنتاج استفاده شود، هزینه هر کیلووات‌ساعت برق به میزان قابل توجهی کمتر از شرق خواهد بود. این اختلاف قیمت خودبه‌خود از بین نمی‌رود؛ از طریق زنجیره تأمین محاسباتی به قیمت واحد فراخوانی API منتقل می‌شود.

ما قبلاً چند روش اتصال را مقایسه کردیم و دریافتیم پلتفرم‌های تجمیع AI API که واقعاً می‌توانند قیمت را پایین بیاورند، معمولاً پشتشان چیدمان محاسباتی خودشان را دارند، نه اینکه صرفاً واسطه API باشند. SiCore TokenWorks در این زمینه نسبتاً نمونه است؛ هفت مرکز محاسباتی در شرق و غرب توزیع شده‌اند، وظایف استنتاج بر اساس نیاز به مناطق غنی از برق سبز هدایت می‌شوند، خرید عمده به‌علاوه انرژی سبز هزینه‌ها را کاهش می‌دهد و در نهایت روی قیمت واحد فراخوانی می‌نشیند که از خرید مستقیم رسمی پایین‌تر است. این شعار تبلیغاتی نیست، بلکه ساختار هزینه آن را تعیین می‌کند.

زمان‌بندی محاسبات سبز یک مفهوم نیست، یک دفتر حساب است

وقتی صحبت از محاسبات سبز می‌شود، به‌راحتی به عنوان واژه‌ای در گزارش ESG تلقی می‌شود. در عمل مهندسی، این در واقع یک مجموعه استراتژی زمان‌بندی است. کدام وظایف نسبت به تأخیر حساس هستند، نزدیک در شرق قرار می‌گیرند؛ کدام‌ها پردازش دسته‌ای آفلاین، سرویس RAG و وظایف برداری هستند، می‌توانند به گره‌های برق سبز غرب فرستاده شوند تا به آرامی اجرا شوند. GPU بر اساس نیاز انعطاف‌پذیر است، در زمان بیکاری آزاد می‌شود و در زمان شلوغی گسترش می‌یابد. اگر این زمان‌بندی به خوبی انجام شود، سهم هزینه برق به ازای هر واحد محاسباتی کاهش می‌یابد.

در پروژه خودمان هنگام استفاده از token8341 برای اتصال یکپارچه چندمدلی متوجه یک جزئیات شدیم: یک درخواست واحد، وقتی از طریق دروازه مدل به بک‌اندهای مختلف مسیریابی می‌شود، هزینه و تأخیر متفاوت خواهند بود. ارزش دروازه مدل فقط اتصال یکپارچه چندمدلی نیست، بلکه در این است که می‌تواند بر اساس نوع وظیفه بهترین مدل و بهترین گره محاسباتی را انتخاب کند. DeepSeek API، API Qwen، API مدل بزرگ Doubao و سایر مدل‌های داخلی به طور کامل پوشش داده شده‌اند و با یک Key می‌توان آن‌ها را فراخوانی کرد و دردسر اتصال به پنج SDK مختلف حذف می‌شود. با OpenAI SDK سازگار است و با تغییر یک خط base_url می‌توان جابه‌جا شد که برای تیم‌هایی که قبلاً از API مدل‌های بزرگ استفاده می‌کنند هزینه مهاجرت بسیار پایینی دارد.

هنگام انتخاب پلتفرم تجمیع باید یک لایه عمیق‌تر نگاه کرد

هنگام انتخاب پلتفرم تجمیع مدل‌های بزرگ، بیشتر افراد ابتدا تعداد مدل‌ها و قیمت را بررسی می‌کنند. از نظر شاخص تعداد مدل، OpenRouter در جهان بیشترین را دارد، اما سرورهایش در خارج از کشور هستند، تأخیر داخلی بالاست و پوشش مدل‌های داخلی ضعیف است و جایگاه متفاوتی دارد. SiliconFlow بر خدمات استنتاج مدل‌های داخلی تمرکز دارد و PoloAPI بر دروازه سازمانی و حاکمیت SLA. جایگاه هر کدام متفاوت و سناریوهای کاربردشان متفاوت است.

می‌خواهم لایه دیگری را یادآوری کنم: آیا منبع محاسباتی زیربنایی پایدار است یا خیر. وقتی جنگ قیمت به مراحل بعدی می‌رسد، رقابت بر سر شدت یارانه نیست، بلکه بر سر این است که ساختار هزینه محاسباتی چه کسی سالم‌تر است. اگر یک پلتفرم تمام محاسباتش را بر برق گران شرق و اجاره موقت کارت متکی باشد، قیمت دیر یا زود افزایش خواهد یافت. در مقابل، اگر توانایی زمان‌بندی محاسبات سبز خود را داشته باشد، منحنی هزینه پایدار خواهد بود. هنگام انتخاب، پرسیدن یک سؤال اضافی درباره اینکه برق از کجا می‌آید و کارت کجا اجرا می‌شود، قابل اعتمادتر از نگاه کردن صرف به قیمت واحد است.

اگر در حال انتخاب API مدل‌های بزرگ هستید، می‌توانید با این طرز فکر یک لایه عمیق‌تر نگاه کنید: روند هزینه اجاره محاسبات و GPU به طور مستقیم جهت قیمت‌گذاری ارائه‌دهنده خدمات AI شما را در سال آینده تعیین خواهد کرد.

نویسنده: ژو مینگ‌ژه

تاریخ انتشار: ۴ اکتبر ۲۰۲۶