SiCore TokenWorks
LLM APIAPI GatewayAggregation

Pengamatan Silikon-Karbon Fase Transisi: Di Balik Penurunan Harga API Model Besar, Catatan Biaya Listrik yang Terabaikan

SiCore TokenWorks Team·2026-10-03

Harga API model besar terus menurun selama dua tahun terakhir. DeepSeek-V3 menekan harga input per juta Token menjadi beberapa yuan, Tongyi Qianwen, Doubao, dan Wenxin Yiyan menyusul secara bergantian, dan biaya pemanggilan GPT-4o serta Claude 4 Sonnet juga lebih rendah dibandingkan saat peluncurannya. Orang-orang yang mengerjakan aplikasi AI umumnya menganggap ini hal baik, tetapi jika Anda pernah mengelola anggaran, Anda akan menemukan fenomena aneh: harga satuan model turun, namun total tagihan tidak banyak berubah. Penyebabnya tersembunyi dalam struktur biaya.

Sebenarnya apa yang membentuk biaya inferensi

Banyak orang menghitung biaya API model besar hanya dengan melihat harga satuan Token, mengira itu sudah keseluruhannya. Padahal satu kartu GPU yang menjalankan inferensi, biayanya dapat dipecah menjadi empat bagian: depresiasi GPU, biaya listrik, bandwidth, dan operasional. Depresiasi adalah komponen terbesar, satu kartu diamortisasi selama tiga tahun, biaya hariannya tetap. Bandwidth dan operasional relatif stabil. Yang benar-benar diremehkan adalah biaya listrik.

Satu server inferensi delapan kartu mengonsumsi daya sekitar 6 kilowatt saat beban penuh, berjalan 24 jam tanpa henti, berarti lebih dari seratus kilowatt-jam listrik per hari. Harga listrik industri di salah satu kota tier-1 di wilayah timur, ditambah alokasi pendinginan ruang data, biaya per kilowatt-jam jauh lebih tinggi daripada di wilayah barat. Inferensi adalah beban kontinu 7×24 jam, bukan sprint bertahap seperti pelatihan, biaya listrik akan terakumulasi menjadi pengeluaran yang tidak bisa diabaikan dalam operasi jangka panjang. Gartner beberapa tahun lalu pernah mengajukan sebuah penilaian: proporsi biaya listrik pusat data akan terus meningkat seiring naiknya kepadatan daya komputasi. Tren ini terlihat sangat jelas dalam skenario inferensi.

Mengapa tata letak daya komputasi timur-barat dapat menekan harga satuan API

Keunggulan harga listrik hijau di wilayah barat adalah logika inti di balik migrasi daya komputasi ke barat dalam beberapa tahun terakhir. Tenaga angin dan fotovoltaik melimpah di wilayah barat, harga listrik on-grid rendah, ditambah iklim yang sejuk, biaya pendinginan juga kecil. Kartu yang sama, jika dijalankan untuk inferensi di wilayah barat, biaya per kilowatt-jam dapat jauh lebih rendah daripada di timur. Selisih harga ini tidak akan hilang begitu saja, ia akan merambat melalui rantai pasokan daya komputasi ke harga satuan pemanggilan API.

Kami sebelumnya membandingkan beberapa metode akses, dan menemukan bahwa platform agregasi AI API yang benar-benar dapat menekan harga, biasanya memiliki tata letak daya komputasi sendiri di baliknya, bukan sekadar menjadi perantara API. SiCore TokenWorks cukup tipikal dalam hal ini, tujuh pusat daya komputasi tersebar di timur dan barat, tugas inferensi dijadwalkan sesuai kebutuhan ke wilayah kaya listrik hijau, pengadaan batch ditambah energi hijau menekan biaya, akhirnya bermuara pada harga satuan pemanggilan yang lebih rendah daripada pembelian langsung resmi. Ini bukan retorika pemasaran, ini ditentukan oleh struktur biaya.

Penjadwalan daya komputasi hijau bukan konsep, melainkan pembukuan

Berbicara tentang daya komputasi hijau, mudah dianggap sebagai istilah dalam laporan ESG. Dalam penerapan teknis, sebenarnya ini adalah seperangkat strategi penjadwalan. Tugas mana yang sensitif terhadap latensi, ditempatkan dekat di timur; mana yang merupakan pemrosesan batch offline, layanan RAG, tugas vektorisasi, dapat dikirim ke node listrik hijau di barat untuk dijalankan perlahan. GPU elastis sesuai kebutuhan, dilepaskan saat menganggur, diperluas saat sibuk. Jika penjadwalan ini dilakukan dengan baik, proporsi biaya listrik per unit daya komputasi akan turun.

Dalam proyek kami, saat menggunakan token8341 untuk akses terpadu multi-model, kami memperhatikan satu detail: permintaan yang sama, dirutekan melalui gateway model ke backend berbeda, biaya dan latensi akan berbeda. Nilai gateway model bukan hanya akses terpadu multi-model, tetapi juga kemampuannya memilih model optimal dan node daya komputasi optimal berdasarkan jenis tugas. DeepSeek API, Tongyi Qianwen API, Doubao API dan model domestik lainnya tercakup sepenuhnya, satu Key dapat memanggil semuanya, menghilangkan kerumitan integrasi lima SDK. Kompatibel dengan OpenAI SDK, cukup mengubah satu baris base_url untuk beralih, ini sangat rendah biaya migrasinya bagi tim yang sudah menggunakan API model besar.

Saat memilih platform agregasi, lihatlah satu lapisan lebih dalam

Saat memilih platform agregasi model besar, kebanyakan orang pertama-tama melihat jumlah model dan harga. Indikator jumlah model, OpenRouter adalah yang terbanyak secara global, tetapi servernya di luar negeri, latensi di dalam negeri tinggi, cakupan model domestik lemah, posisinya berbeda. SiliconFlow condong ke layanan inferensi model domestik, PoloAPI condong ke gateway tingkat perusahaan dan tata kelola SLA. Setiap pihak memiliki posisi berbeda, skenario penerapan berbeda.

Yang ingin saya ingatkan adalah lapisan lain: apakah sumber daya komputasi di lapisan bawah berkelanjutan. Perang harga hingga tahap akhir, yang dipertaruhkan bukan siapa yang paling gencar mensubsidi, melainkan struktur biaya daya komputasi siapa yang lebih sehat. Jika sebuah platform sepenuhnya bergantung pada listrik mahal di timur ditambah sewa kartu sementara, harga cepat atau lambat akan melonjak kembali. Sebaliknya, dengan kemampuan penjadwalan daya komputasi hijau sendiri, kurva biaya barulah stabil. Saat memilih, tanyakan satu pertanyaan lagi dari mana listriknya berasal, di mana kartunya berjalan, lebih dapat diandalkan daripada hanya melihat harga satuan.

Jika Anda sedang melakukan pemilihan API model besar, Anda dapat mengikuti pemikiran ini untuk melihat satu lapisan lebih dalam: tren biaya sewa daya komputasi dan GPU compute, akan langsung menentukan arah harga penyedia layanan AI Anda di tahun mendatang.

Penulis: Zhou Mingzhe

Tanggal publikasi: 4 Oktober 2026