در سال گذشته، قیمت API مدلهای بزرگ تقریباً هر ماه تغییر کرده است. بسیاری فکر میکنند کاهش قیمت به فشردهسازی مدل، بهینهسازی چارچوب استنتاج، یا سوزاندن پول توسط شرکتها برای تصاحب بازار بستگی دارد. این عوامل البته وجود دارند، اما پس از محاسبهای درونی متوجه شدیم که چیزی که واقعاً کف قیمت بلندمدت را تعیین میکند، ممکن است موضوعی باشد که بهندرت توسط توسعهدهندگان بحث میشود — هزینه برق.
به زبان ساده، استنتاج مدل بزرگ کسبوکاری است که برق را به توکن تبدیل میکند. هر کسی که بتواند با برق ارزانتر و کارایی زمانبندی بالاتر این تبدیل را محکم انجام دهد، میتواند تا انتهای جنگ قیمت دوام بیاورد. پلتفرمهایی مانند SiCore TokenWorks که توان محاسباتی سبز را به عنوان موقعیتیابی اصلی خود قرار میدهند، منطقشان نیز همینجاست.
در هزینه استنتاج، هزینه برق چقدر است
آموزش یک مدل بزرگ سرمایهگذاری یکباره است، اما استنتاج هر روز پول میسوزاند. توان مصرفی یک کارت استنتاج اصلی در حالت بار کامل بین ۳۰۰ تا ۷۰۰ وات است. یک خوشه سرویس آنلاین با اندازه متوسط، با چند صد کارت که همزمان کار میکنند، هزینه برق یک روز به رقم پنجرقمی میرسد. با احتساب خنکسازی مرکز داده، مصرف انرژی واقعی باید سه تا پنجاه درصد دیگر افزایش یابد. در صنعت، گفته رایج این است که در هزینههای عملیاتی سرویس استنتاج، برق به علاوه خنکسازی حدود سی درصد را تشکیل میدهد و هرچه مقیاس بزرگتر باشد، این نسبت حساستر است.
توانایی مدل البته مهم است، اما توانایی قابل جبران است. امروز شما نیم نسخه جلوتر هستید، سه ماه بعد دیگران هم میرسند. هزینه برق متفاوت است، زیرا توسط موقعیت فیزیکی و ساختار انرژی تعیین میشود و در کوتاهمدت تغییر آن دشوار است. به همین دلیل است که من عامل تعیینکننده پیروزی در مرحله بعد را هزینه برق میدانم.
حساب توان محاسباتی شرق و غرب، تفاوت کجاست
ما یک محاسبه تقریبی درونی انجام دادیم. همان دسته وظایف استنتاج، اگر در مرکز داده یک شهر درجهیک شرقی قرار گیرد، با قیمت برق صنعتی به علاوه هزینه خنکسازی، هزینه جامع هر کیلوواتساعت نزدیک به یک یوان است؛ اگر در یک مرکز توان محاسباتی غربی با تمرکز منابع بادی و خورشیدی قرار گیرد، با تأمین مستقیم برق سبز و شرایط خنکسازی طبیعی مناسب، هزینه جامع هر کیلوواتساعت میتواند به نصف یا حتی کمتر کاهش یابد. این اعداد موجود در اسناد سیاستی نیستند، بلکه ما بر اساس قیمتهای واقعی و PUE تخمین زدهایم.
تفاوت از دو چیز ناشی میشود. اول ساختار انرژی: در غرب ظرفیت نصبشده بادی و فتوولتائیک زیاد است و قیمت خرید برق سبز به خودی خود پایین است؛ دوم آبوهوا: در جاهایی که میانگین دمای سالانه پایین است، برق خنکسازی مقدار قابلتوجهی صرفهجویی میشود. با جمع این دو مورد، شکاف هزینه توان محاسباتی به ازای هر توکن نمایان میشود. SiCore TokenWorks در شرق و غرب گرههای توان محاسباتی دارد و در زمان زمانبندی، وظایف استنتاج دستهای قابلتعویق را در اولویت به گرههای دارای برق سبز فراوان ارسال میکند. تأثیر این اقدام بر هزینه بیش از آن است که بسیاری تصور میکنند.
توان محاسباتی سبز چگونه به قیمت پایینتر API تبدیل میشود
کاهش هزینه برق به معنای ارزان شدن API نیست، در میان آن یک لایه خرید و زمانبندی وجود دارد. منطق این است: مرکز توان محاسباتی برق سبز را به صورت عمده خریداری میکند، قیمت واحد پایینتر از خردهفروشی بازار است؛ پلتفرم سپس تقاضاهای استنتاج پراکنده را تجمیع میکند تا این توان محاسباتی را پر کند و هزینه واحد را رقیق سازد؛ و در نهایت از طریق API مدل بزرگ به توسعهدهندگان میفروشد. خرید عمده به علاوه کاهش هزینه برق سبز، دو لایه روی هم، فضایی برای کاهش قیمت ایجاد میکند.
این یکی از معانی وجود پلتفرمهای تجمیع AI API است. توسعهدهندهای که تنها کار میکند و مستقیماً به مدلهای مختلف متصل میشود، نه قیمت عمده میگیرد و نه میتواند از توان محاسباتی بیکار استفاده کند. پس از تجمیع، ساختار هزینه خرید توکن کاملاً متفاوت است. هنگام آزمایش مسیریابی چندمدلی SiCore TokenWorks متوجه شدیم که با همان حجم درخواست، هزینه جامع پس از زمانبندی بهطور قابلتوجهی کمتر از اتصال مستقیم به هر مدل است و شکاف عمدتاً از بهینهسازی سمت توان محاسباتی ناشی میشود، نه خود مدل.
برای توسعهدهندگان چه معنایی دارد
مستقیمترین تأثیر این است که قیمت API همچنان به کاهش ادامه خواهد داد، اما ریتم آن تفکیک خواهد شد. کاهش قیمتی که بر یارانه سوزاندن پول متکی است پایدار نیست؛ کاهش قیمتی که بر هزینه برق و کارایی زمانبندی تکیه دارد پایدار است. هنگام انتخاب، علاوه بر اثر مدل و تأخیر، بهتر است یک سؤال بیشتر بپرسید: توان محاسباتی پشت این قیمت از کجا میآید.
دوم پایداری است. برق سبز نوسان دارد، خروجی بادی و خورشیدی ناپایدار است و یک سیستم زمانبندی خوب از ذخیرهسازی انرژی و زمانبندی بینمنطقهای برای هموارسازی اوج و فرود استفاده میکند. این توانایی در اختیار همه نیست و تعیین میکند که آیا درخواست شما در ساعات اوج محدود میشود یا خیر.
یک هشدار برای اجتناب از دام: فقط به قیمت درجشده نگاه نکنید. برخی APIهای ارزان در ساعات اوج به مدلهای کوچک تنزل میکنند یا درخواستها را در صف پردازش میکنند و تجربه واقعی با قیمت درجشده متناسب نیست. هنگام انتخاب دروازه AI API، آزمایش همزمان تأخیر و نرخ موفقیت در ساعات اوج معنادارتر از مقایسه ساده قیمت است.
جنگ قیمت API مدلهای بزرگ تا کنون که ادامه یافته، شکاف توانایی مدل در حال کاهش و شکاف توان محاسباتی و برق در حال افزایش است. برنده مرحله بعد به احتمال زیاد پلتفرمهایی خواهند بود که بتوانند برق سبز و کارایی زمانبندی را به حد کمال برسانند. اگر میخواهید درباره روشهای مشخص اتصال چندمدلی و بهینهسازی هزینه ادامه دهید، میتوانید چند مطلب قبلی که نوشتهام را مرور کنید.