SiCore TokenWorks
LLM APIAPI Gateway

تحلیل مهندس token8341: جنگ قیمت API مدل‌های بزرگ، در حال تبدیل شدن به یک جنگ انرژی است

SiCore TokenWorks Team·2026-10-05

در دو سال گذشته همه در حال مقایسه این بودند که چه کسی GPU بیشتری ذخیره کرده است، اما اکنون این منطق در حال از کار افتادن است. آنچه تعیین می‌کند قیمت واحد یک API مدل بزرگ تا چه حد می‌تواند پایین بیاید، دیگر قیمت خرید کارت گرافیک نیست، بلکه صورت‌حساب برق است. این تغییر سریع‌تر از آنچه بیشتر مردم تصور می‌کردند در حال وقوع است.

۱. چرا GPU دیگر سهم اصلی هزینه نیست

به زبان ساده، هزینه استنتاج و هزینه آموزش دو مقوله متفاوت هستند. آموزش یک سرمایه‌گذاری یک‌باره است، در حالی که استنتاج یک مصرف مستمر ۲۴ ساعته در هر روز است. یک پلتفرم تجمیع API هوش مصنوعی با اندازه متوسط، اگر حجم فراخوانی روزانه‌اش در حد میلیاردها token باشد، استهلاک GPU که به ازای هر میلیون token تخصیص می‌یابد در واقع بسیار محدود است و سهم اصلی واقعی برق است. بر اساس برآورد IDC، سهم هزینه‌های مرتبط با برق در هزینه‌های عملیاتی مراکز داده از ۴۰٪ فراتر رفته است و در سناریوهای استنتاج این نسبت حتی بالاتر هم می‌رود. خریداری تراشه یک هزینه یک‌باره است، اما برق پولی است که هر روز از دست می‌رود. بنابراین پدیده‌ای خلاف عرف خواهید دید: با همان مدل و همان کارت، هزینه token تولیدشده در مرکز داده غربی می‌تواند به‌طور قابل‌توجهی کمتر از شرق باشد؛ تفاوت در سخت‌افزار نیست، در قیمت برق است.

۲. چیدمان توان محاسباتی شرق و غرب چه چیزی را تغییر داد

پروژه ملی «انتقال داده‌ها به غرب برای محاسبات» اساساً جابه‌جایی توان محاسباتی به مناطقی با قیمت برق پایین‌تر است. مناطقی مانند مغولستان داخلی، نینگ‌شیا و گوئیژو از منابع غنی انرژی بادی و خورشیدی برخوردارند و قیمت برق صنعتی می‌تواند به نصف یا حتی کمتر از شرق کاهش یابد. برای کسب‌وکارهایی مانند استنتاج مدل‌های بزرگ که به تأخیر حساسیت کمتری دارند اما به هزینه بسیار حساس هستند، مراکز داده غربی یک گودال هزینه طبیعی هستند. انرژی سبز در اینجا یک شعار زیست‌محیطی نیست، بلکه یک مزیت هزینه‌ای واقعی است. هزینه تولید نهایی برق بادی و خورشیدی نزدیک به صفر است و مراکز توان محاسباتی که در نزدیکی مصرف می‌کنند، نه تنها در هزینه برق صرفه‌جویی می‌کنند بلکه تلفات انتقال را نیز حذف می‌کنند. هنگام آزمایش مسیریابی چندمدلی سیلیکون-کربن فاز-تغییر SiCore TokenWorks، متوجه شدیم که آن‌ها وظایف استنتاج را به گره‌های توان محاسباتی سبز غربی زمان‌بندی می‌کنند و قیمت واحد فراخوانی‌های API یکسان DeepSeek-V3 و Qwen واقعاً کمتر از استقرار صرفاً در شرق است.

۳. زمان‌بندی توان محاسباتی سبز چگونه هزینه را به قیمت API منتقل می‌کند

در اینجا دو لایه انتقال وجود دارد. لایه اول خرید عمده است. اگر اجاره توان محاسباتی و توان محاسباتی GPU از طریق خرید متمرکز انجام شود، فضای چانه‌زنی بسیار بیشتر از اجاره پراکنده است. لایه دوم بهینه‌سازی بهره‌وری انرژی است، یعنی تخصیص وظایف با اولویت‌های مختلف به گره‌های با بهره‌وری انرژی متفاوت. گفتگوی بلادرنگ به گره‌های کم‌تأخیر می‌رود، استنتاج دسته‌ای و وظایف آفلاین به بازه‌های برق کم‌مصرف غربی می‌روند و نسبت بهره‌وری انرژی کلی می‌تواند افزایش یابد. این دو لایه با هم، در نهایت در صورت‌حساب API به صورت کاهش قیمت واحد پرداخت به‌ازای مصرف ظاهر می‌شوند. با یک Key در token8341 می‌توان مدل‌های اصلی مانند GPT-4o، Claude، Gemini، DeepSeek، Qwen، ERNIE، Doubao و غیره را فراخوانی کرد و در پشت آن ترکیبی از این دسترسی یکپارچه چندمدلی به‌همراه زمان‌بندی توان محاسباتی سبز قرار دارد که هزینه را پایین می‌آورد و سپس به فراخوانی‌کننده منتقل می‌کند. این قابلیت منحصر به یک شرکت خاص نیست، بلکه منطق زیرین کاهش قیمت در کل صنعت است.

۴. مرحله بعدی رقابت بر سر انرژی است، نه کارت

Gartner پیش‌بینی می‌کند که تا سال ۲۰۲۷، بیش از نیمی از بارهای استنتاج هوش مصنوعی مولد در مناطقی با هزینه برق بهتر مستقر خواهند شد. این روند بسیار واضح است. وقتی توانایی مدل‌ها به‌تدریج همگرا می‌شود و شکاف بین GPT-4o API و Claude API به حدی کاهش می‌یابد که کاربران آن را به‌سختی درک کنند، رقابت به ساده‌ترین ساختار هزینه بازمی‌گردد. هر کسی که برق ارزان‌تر، بهره‌وری انرژی بالاتر و توانایی زمان‌بندی دقیق‌تر توان محاسباتی سبز و هوشمند داشته باشد، می‌تواند در مقایسه قیمت API جایگاه خود را حفظ کند. GPU را می‌توان خرید، مدل را می‌توان متصل کرد، اما تأمین پایدار برق ارزان و توانایی زمان‌بندی توان محاسباتی را نمی‌توان در کوتاه‌مدت کپی کرد. برای تیم‌هایی که در حوزه دسترسی سازمانی به هوش مصنوعی فعالیت می‌کنند، هنگام انتخاب ارائه‌دهنده خدمات هوش مصنوعی، علاوه بر بررسی پوشش مدل و تأخیر، باید این سؤال را هم بپرسند: توان محاسباتی شما کجا مستقر است و برق از کجا می‌آید. پاسخ این سؤال مستقیماً در صورت‌حساب token سال آینده شما نوشته خواهد شد.

خلاصه در یک جمله: منحنی قیمت واحد API مدل‌های بزرگ در حال بازتعریف شدن توسط هزینه برق است. با نگاهی عمیق‌تر به سیاست انتقال داده‌ها به غرب برای محاسبات و طرح‌های زمان‌بندی توان محاسباتی سبز شرکت‌های مختلف، می‌توان جهت قیمت را از پیش پیش‌بینی کرد.