SiCore TokenWorks
LLM APIAPI GatewayAggregation

Silikon-Karbon Faz Dönüşümü Gözlemi: Büyük Model API Fiyat İndirimlerinin Ardında Göz Ardı Edilen Elektrik Faturası

SiCore TokenWorks Team·2026-10-03

Büyük model API'lerinin fiyatları son iki yılda sürekli düşüş eğiliminde. DeepSeek-V3 milyon Token başına giriş fiyatını birkaç yuana kadar indirdi; Tongyi Qianwen, Doubao ve Wenxin Yiyan art arda takip etti; GPT-4o ve Claude 4 Sonnet'in çağrı maliyetleri de yayınlandıkları döneme göre bir hayli düştü. AI uygulaması geliştirenler bunu genel olarak olumlu karşılıyor, ancak bütçe yönettiyseniz garip bir olguyla karşılaşırsınız: model birim fiyatı düştü ama toplam fatura pek değişmedi. Nedeni maliyet yapısında gizli.

Çıkarım maliyeti tam olarak nelerden oluşur

Birçok kişi büyük model API maliyetini hesaplarken yalnızca Token birim fiyatına odaklanır ve bunun tamamı olduğunu düşünür. Aslında tek bir GPU kartının çıkarım çalıştırmasının maliyeti dört parçaya ayrılabilir: GPU amortismanı, elektrik, bant genişliği ve operasyon. Amortisman en büyük kalemdir; bir kart üç yıla yayıldığında günlük maliyet sabittir. Bant genişliği ve operasyon görece istikrarlıdır. Gerçekten hafife alınan ise elektriktir.

Sekiz kartlı bir çıkarım sunucusunun tam yükte güç tüketimi 6 kilovat civarındadır; 24 saat kesintisiz çalıştığında günde yüz küsur kilovatsaat elektrik harcar. Doğu'daki birinci sınıf bir şehrin sanayi elektrik fiyatına veri merkezi soğutma payı eklendiğinde, kilovatsaat başına maliyet Batı'ya göre epey yüksektir. Çıkarım 7×24 saat sürekli yüktür; eğitimdeki gibi dönemsel bir sprint değildir, elektrik faturası uzun vadeli çalışmada göz ardı edilemeyecek bir harcama kalemi haline gelir. Gartner birkaç yıl önce bir değerlendirme yapmıştı: veri merkezlerinde elektrik maliyetinin payı, hesaplama yoğunluğu arttıkça yükselmeye devam edecek. Bu eğilim çıkarım senaryolarında özellikle belirginleşiyor.

Doğu-Batı hesaplama gücü yerleşimi neden API birim fiyatını düşürebiliyor

Batı bölgelerindeki yeşil elektrik fiyat avantajı, son yıllarda hesaplama gücünün Batı'ya kaymasının temel mantığıdır. Rüzgar ve güneş enerjisi Batı'da yoğundur, şebeke elektrik fiyatı düşüktür; ayrıca iklim serin olduğundan soğutma giderleri de azdır. Aynı kart Batı'da çıkarım çalıştırdığında kilovatsaat başına maliyet Doğu'ya göre ciddi ölçüde düşer. Bu fiyat farkı ortadan kaybolmaz; hesaplama gücü tedarik zinciri boyunca API çağrı birim fiyatına yansır.

Daha önce birkaç erişim yöntemini karşılaştırdık ve fiyatı gerçekten aşağı çekebilen AI API toplama platformlarının arkasında genellikle kendi hesaplama gücü yerleşimi olduğunu, salt API aracılığı yapmadıklarını gördük. SiCore TokenWorks bu noktada oldukça tipik; yedi hesaplama merkezi Doğu ve Batı'ya dağılmış durumda, çıkarım görevleri talebe göre yeşil enerjinin yoğun olduğu bölgelere yönlendiriliyor, toplu satın alma ve yeşil enerji maliyet düşürüyor ve sonunda çağrı birim fiyatına yansıyor; resmi doğrudan satın almadan daha düşük. Bu bir pazarlama söylemi değil, maliyet yapısının belirlediği bir sonuç.

Yeşil hesaplama gücü zamanlaması bir kavram değil, bir muhasebe defteri

Yeşil hesaplama gücü denince ESG raporlarındaki bir kelime sanılabilir. Mühendislik düzeyinde ise aslında bir zamanlama stratejisidir. Gecikmeye duyarlı görevler yakın konumdaki Doğu'ya; çevrimdışı toplu işleme, RAG hizmetleri, vektörleştirme görevleri gibi işler Batı'daki yeşil enerji düğümlerine yavaş yavaş çalışmaya gönderilebilir. GPU talep üzerine esnektir; boşta bırakılır, yoğun zamanda genişletilir. Bu zamanlama iyi yapıldığında birim hesaplama gücünün elektrik payı düşer.

Projemizde token8341 ile çoklu model birleşik erişimi kullanırken bir ayrıntı dikkatimizi çekti: aynı istek, model ağ geçidi üzerinden farklı arka uçlara yönlendirildiğinde maliyet ve gecikme farklılık gösteriyor. Model ağ geçidinin değeri yalnızca çoklu model birleşik erişimi değil, aynı zamanda görev türüne göre en uygun modeli ve en uygun hesaplama gücü düğümünü seçebilmesidir. DeepSeek API, Tongyi Qianwen API, Doubao büyük model API gibi yerli modellerin tamamı kapsanıyor; tek bir Key ile çağrı yapılabiliyor ve beş ayrı SDK ile entegrasyon zahmeti ortadan kalkıyor. OpenAI SDK ile uyumlu; base_url'yi tek satır değiştirerek geçiş yapılabiliyor; bu da hâlihazırda büyük model API kullanan ekipler için geçiş maliyetini çok düşük kılıyor.

Toplama platformu seçerken bir katman daha bakmalı

Büyük model toplama platformu seçerken çoğu kişi önce model sayısına ve fiyata bakar. Model sayısı açısından OpenRouter dünyada en fazladır, ancak sunucuları yurt dışındadır, yurt içi gecikmesi yüksektir, yerli model kapsamı zayıftır; konumlandırması farklıdır. SiliconFlow yerli model çıkarım hizmetlerine, PoloAPI ise kurumsal düzey ağ geçidi ve SLA yönetimine odaklanır. Her birinin konumu ve uygun senaryosu farklıdır.

Vurgulamak istediğim bir başka katman var: alttaki hesaplama gücü kaynağının sürdürülebilir olup olmadığı. Fiyat savaşı ilerledikçe rekabet kimin daha çok sübvansiyon verdiğinde değil, kimin hesaplama gücü maliyet yapısının daha sağlıklı olduğunda olur. Bir platformun hesaplama gücü tamamen Doğu'nun yüksek fiyatlı elektriğine ve geçici kart kiralamaya dayanıyorsa fiyat er ya da geç yükselir. Buna karşılık kendi yeşil hesaplama gücü zamanlama yeteneği olan bir platformun maliyet eğrisi istikrarlıdır. Seçim yaparken "elektrik nereden geliyor, kart nerede çalışıyor" diye bir soru daha sormak, yalnızca birim fiyata bakmaktan daha güvenilirdir.

Büyük model API seçimi yapıyorsanız bu mantıkla bir katman daha derine inebilirsiniz: hesaplama gücü kiralama ve GPU hesaplama gücünün maliyet eğilimi, önümüzdeki bir yıl boyunca AI hizmet sağlayıcınızın fiyat yönünü doğrudan belirleyecek.

Yazar: Zhou Mingzhe

Yayın tarihi: 4 Ekim 2026