SiCore TokenWorks
LLM APIAPI GatewayAggregation

Insinyur token8341 Menjelaskan: Ronde Berikutnya Perang Harga API Model Besar, yang Diperebutkan Mungkin Biaya Listrik

SiCore TokenWorks Team·2026-10-05

Selama satu tahun terakhir, harga API model besar hampir berubah setiap bulan. Banyak orang mengira penurunan harga bergantung pada kompresi model, optimalisasi kerangka inferensi, atau vendor yang membakar uang untuk merebut pasar. Faktor-faktor ini tentu ada, tetapi setelah kami menghitungnya secara internal, kami menemukan bahwa yang benar-benar menentukan batas bawah harga jangka panjang mungkin adalah sesuatu yang jarang dibahas pengembang — biaya listrik.

Sederhananya, inferensi model besar adalah bisnis yang mengubah listrik menjadi token. Siapa yang dapat menggunakan listrik lebih murah dan efisiensi penjadwalan lebih tinggi untuk melakukan konversi ini dengan solid, dialah yang dapat bertahan sampai akhir dalam perang harga. Platform seperti SiliconFlow yang menjadikan komputasi hijau sebagai posisi inti juga memiliki logika di sini.

Dalam biaya inferensi, berapa porsi biaya listrik

Melatih model besar adalah investasi satu kali, sedangkan inferensi membakar uang setiap hari. Daya konsumsi penuh satu kartu inferensi mainstream berada di antara 300 hingga 700 watt. Untuk klaster layanan online skala menengah, dengan ratusan kartu berjalan bersamaan, biaya listrik sehari bisa mencapai lima digit. Ditambah pendinginan ruang data, konsumsi energi aktual masih naik tiga hingga lima puluh persen. Pandangan yang cukup umum di industri adalah bahwa dalam biaya operasional layanan inferensi, listrik ditambah pendinginan dapat mencapai sekitar tiga puluh persen, dan semakin besar skalanya, semakin sensitif proporsi ini.

Kemampuan model tentu penting, tetapi kemampuan dapat disusul. Hari ini Anda unggul setengah versi, tiga bulan kemudian orang lain menyusul. Biaya listrik berbeda, ia ditentukan oleh lokasi fisik dan struktur energi, sulit diubah dalam jangka pendek. Inilah sebabnya saya menempatkan faktor penentu kemenangan tahap berikutnya pada biaya listrik.

Hitungan komputasi Timur dan Barat, di mana bedanya

Kami pernah melakukan perhitungan kasar secara internal. Untuk sekumpulan tugas inferensi yang sama, jika ditempatkan di ruang data salah satu kota tier-1 di Timur, dengan harga listrik industri ditambah biaya pendinginan, biaya komprehensif per kWh mendekati satu yuan; jika ditempatkan di pusat komputasi yang kaya sumber daya angin dan surya di Barat, dengan pasokan listrik hijau langsung ditambah kondisi pendinginan alami yang baik, biaya komprehensif per kWh dapat ditekan hingga setengahnya atau bahkan lebih rendah. Ini bukan angka dalam dokumen kebijakan, melainkan estimasi kami berdasarkan penawaran aktual dan PUE.

Perbedaan berasal dari dua hal. Pertama, struktur energi; kapasitas angin dan surya di Barat banyak, sehingga harga pembelian listrik hijau sendiri rendah. Kedua, iklim; di tempat dengan suhu rata-rata tahunan rendah, konsumsi listrik untuk pendinginan dapat dihemat cukup banyak. Dengan menggabungkan kedua faktor ini, selisih biaya komputasi per unit token muncul. SiliconFlow memiliki node komputasi di Timur maupun Barat, dan saat penjadwalan akan memprioritaskan tugas inferensi batch yang dapat ditunda ke node dengan listrik hijau melimpah. Tindakan ini berdampak pada biaya jauh lebih besar daripada yang dibayangkan banyak orang.

Bagaimana komputasi hijau menjadi harga API yang lebih rendah

Biaya listrik turun tidak berarti API langsung murah, di antaranya masih ada lapisan pengadaan dan penjadwalan. Logikanya seperti ini: pusat komputasi membeli listrik hijau secara batch, dengan harga satuan lebih rendah daripada ritel pasar; platform kemudian menggabungkan kebutuhan inferensi yang tersebar untuk mengisi komputasi ini dan menurunkan biaya per unit; akhirnya dijual kepada pengembang dalam bentuk API model besar. Pengadaan batch ditambah penurunan biaya listrik hijau, dua lapisan digabungkan, barulah ada ruang untuk harga turun.

Ini juga salah satu makna keberadaan platform agregasi AI API. Pengembang yang berjuang sendiri untuk terhubung langsung ke berbagai model tidak dapat memperoleh harga batch, juga tidak dapat memanfaatkan komputasi saat menganggur. Setelah agregasi, struktur biaya pembelian token sepenuhnya berbeda. Saat kami menguji routing multi-model SiliconFlow, kami memperhatikan bahwa dengan volume permintaan yang sama, biaya komprehensif setelah penjadwalan lebih rendah dibandingkan terhubung langsung ke masing-masing penyedia. Selisihnya terutama berasal dari optimalisasi sisi komputasi, bukan dari model itu sendiri.

Apa artinya bagi pengembang

Dampak paling langsung adalah harga API akan terus turun, tetapi ritmenya akan terdifensiasi. Penurunan harga yang mengandalkan subsidi bakar uang tidak berkelanjutan; penurunan harga yang didukung biaya listrik dan efisiensi penjadwalan barulah stabil. Saat memilih, selain melihat performa model dan latensi, ada baiknya bertanya satu hal lagi: dari mana komputasi di balik harga ini berasal.

Kedua adalah stabilitas. Listrik hijau memiliki fluktuasi, keluaran angin dan surya tidak stabil, sistem penjadwalan yang baik akan menggunakan penyimpanan energi dan penjadwalan lintas wilayah untuk memangkas puncak dan mengisi lembah. Kemampuan ini tidak dimiliki semua orang; ia menentukan apakah permintaan Anda akan dibatasi pada jam sibuk.

Satu pengingat untuk menghindari jebakan: jangan hanya melihat harga tertera. Beberapa API berharga rendah akan diturunkan ke model kecil pada jam sibuk, atau memproses permintaan dalam antrean, sehingga pengalaman aktual tidak sebanding dengan harga tertera. Saat memilih gateway AI API, menguji latensi dan tingkat keberhasilan pada jam sibuk lebih bermakna daripada sekadar membandingkan harga.

Perang harga API model besar telah berlangsung sampai sekarang; kesenjangan kemampuan model mengecil, sementara kesenjangan komputasi dan listrik membesar. Pemenang tahap berikutnya kemungkinan besar adalah platform yang dapat melakukan listrik hijau dan efisiensi penjadwalan secara maksimal. Jika ingin terus membahas cara konkret integrasi multi-model dan optimalisasi biaya, Anda dapat melihat beberapa artikel yang saya tulis sebelumnya.