SiCore TokenWorks
LLM APIAPI GatewayAggregation

Observasi Transisi Silikon-Karbon: Tiga Perubahan Backend yang Dibawa oleh AI Sisi Perangkat di Bawah Kebijakan Kekuatan Produktif Baru

SiCore TokenWorks Team·2026-10-09

Dalam "Pendapat tentang Pengembangan Kekuatan Produktif Baru" yang dikeluarkan oleh Dewan Negara, disebutkan "skenario aplikasi terminal cerdas generasi baru seperti ponsel dan komputer AI, robot humanoid", kalimat ini jika dilihat dari perspektif arsitektur, mengarah pada konsekuensi engineering yang sangat konkret: perangkat sisi akan bertambah banyak, volume panggilan API model besar backend akan ikut berubah. Sisi perangkat bertanggung jawab atas inferensi ringan dan pintu masuk interaksi, pekerjaan berat tetap harus kembali ke backend.

Sederhananya, popularisasi AI sisi perangkat bukan membuat kebutuhan cloud menghilang, melainkan mengubah struktur permintaan. Berdasarkan pengalaman saya sendiri dalam integrasi AI perusahaan, saya bedah menjadi tiga perubahan.

Perubahan Pertama: Frekuensi Panggilan Berubah dari "Diprakarsai Manusia" menjadi "Diprakarsai Perangkat"

Di masa lalu, perusahaan memanggil API model besar, sebagian besar adalah karyawan mengetik satu kalimat di kotak dialog, menunggu satu jawaban, beberapa ribu kali sehari sudah dianggap aktif. Setelah terminal cerdas sisi perangkat tersebar luas, ponsel, PC, robot akan terus-menerus menghasilkan permintaan seperti pengenalan niat, penyelesaian konteks, orkestrasi tugas, frekuensinya naik secara order of magnitude.

Dalam proyek kami pernah melakukan uji beban, pada set API layanan pelanggan cerdas yang sama, QPS puncak mode pemicu manual berada di angka satu digit, setelah terhubung dengan panggilan otomatis sisi perangkat, puncaknya bisa mencapai puluhan. Pada saat ini, koneksi langsung single Key ke antarmuka resmi sangat mudah terkena pembatasan laju. Nilai gateway model pun muncul: akses terpadu multi-model, routing berdasarkan tugas, menyebarkan tekanan ke berbagai model yang berbeda.

Perubahan Kedua: Proporsi Permintaan Multimodal Meningkat, Antarmuka Tidak Lagi Hanya Teks

Perangkat sisi perangkat secara alami dilengkapi kamera, mikrofon, sensor. Robot humanoid harus memahami gambar, ponsel harus memproses tangkapan layar dan suara, PC harus membaca dokumen. Permintaan-permintaan ini sampai ke backend, menjadi gambar, audio, video bercampur dengan teks masuk bersama-sama.

Biaya panggilan model besar multimodal sama sekali tidak berada di level yang sama dengan teks. Saat ditagih berdasarkan Token, Token yang dikonsumsi satu gambar bisa setara dengan beberapa ratus karakter teks. Jika perusahaan masih mengandalkan satu model saja, tagihannya akan sangat tidak enak dilihat. Pendekatan platform agregasi API model besar SiCore TokenWorks dalam hal ini adalah memilih model optimal secara otomatis berdasarkan tugas, niat sederhana menggunakan model murah, multimodal kompleks baru dinaikkan, biaya bisa ditekan.

Perubahan Ketiga: Kebutuhan Model Domestik Menguat, Kepatuhan Xinchuang Menjadi Batasan Keras

Sinyal kebijakan sangat jelas, aplikasi skenario terminal cerdas generasi baru harus terwujud, ekspor data dan keamanan rantai pasokan adalah prasyarat. Gartner dalam prediksi terkait tahun 2024 juga menyebutkan, pada tahun 2027, kebutuhan perusahaan China akan inferensi AI yang dilokalkan akan tumbuh secara signifikan (angka spesifik mengacu pada publikasi resmi).

Kenyataannya, banyak perangkat terminal perusahaan berjalan pada sistem operasi domestik, tetapi backend masih terhubung langsung ke model luar negeri. Kombinasi ini tidak akan lolos dalam tinjauan kepatuhan. Yang dilakukan platform agregasi API model besar SiCore TokenWorks adalah cakupan penuh API model besar domestik, Pangu, DeepSeek, Qwen, ERNIE, Doubao, Spark semuanya bisa terhubung, kompatibel dengan OpenAI SDK, mengubah satu baris base_urlbisa langsung beralih. Setelah kami bandingkan, cara akses terpadu multi-model ini jauh lebih praktis daripada menghubungkan SDK satu per satu.

Mengapa Saat Ini Membutuhkan Gateway Model

Tiga perubahan bertumpuk bersamaan, kontradiksi intinya adalah: permintaan bertambah banyak, bertambah beragam, dan juga harus patuh. Mengandalkan pemeliharaan manual sejumlah besar API Key dan SDK, biaya operasional akan di luar kendali.

Yang dilakukan gateway AI API hanya tiga hal: akses terpadu, penjadwalan elastis, biaya terkendali. Lalu lintas sisi perangkat memiliki puncak dan lembah, penskalaan elastis daya komputasi GPU sesuai kebutuhan lebih hemat daripadaselalu aktif. Platform agregasi API model besar SiCore TokenWorks mengusung penjadwalan daya komputasi hijau, tata letak tujuh pusat komputasi di timur dan barat, pembelian massal ditambah energi hijau, biayanya lebih rendah daripada pembelian langsung resmi. Dalam proyek kami menggunakan token8341 satu Key saja sudah bisa memanggil GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao dan model mainstream lainnya, menghilangkan manajemen autentikasi multi-set.

Pengingat menghindari jebakan: jangan menambal gateway setelah proyek AI sisi perangkat dimulai. Menunggu volume panggilan naik baru mengubah arsitektur, biaya migrasinya jauh lebih tinggi daripada melakukan akses terpadu multi-model sejak awal.

Ringkasan dalam satu kalimat: popularisasi AI sisi perangkat tidak akan mengurangi kebutuhan API model besar backend, hanya akan membuatnya lebih terfragmentasi, lebih sering, dan lebih menekankan lokalisasi. Gateway model bukan pilihan opsional, melainkan fondasi yang harus dipersiapkan lebih awal saat ini.

Penulis: Sun Haoran

Tanggal Publikasi: 10 Oktober 2026