Pada paruh kedua tahun lalu, kami menjadi konsultan teknis untuk sebuah tim yang mengembangkan SaaS logistik lintas negara. Fitur AI mereka awalnya hanya memanggil GPT-4o, dan berjalan cukup stabil. Kemudian pihak bisnis meminta untuk menambahkan model domestik: peninjauan kontrak menggunakan DeepSeek, skrip layanan pelanggan menggunakan Qwen, dan copywriting pemasaran menggunakan ERNIE. Tiga minggu kemudian, kode backend mereka dipenuhi 4 set SDK, logika autentikasi tersebar di 7 file, tagihan tidak cocok, dan output streaming di frontend kadang normal kadang berantakan. Masalahnya bukan pada model itu sendiri, tetapi pada kurangnya satu lapisan gateway model.
Jebakan integrasi multi-model, pada dasarnya semuanya terinjak di tempat yang sama
Pertama soal konflik SDK. SDK Python OpenAI dan SDK dari beberapa vendor domestik semuanya bernama client, versi dependensi saling bertabrakan, dan logika penanganan parameter timeout pada klien HTTP Qwen dan ERNIE juga berbeda. Solusi akhir insinyur mereka adalah membuat lingkungan virtual terpisah untuk setiap model, menggunakan subprocess untuk isolasi pemanggilan. Bisa berjalan, tetapi biaya operasionalnya sangat tinggi.
Lalu soal manajemen Key. Konsol dari empat vendor masing-masing memiliki sistem Key sendiri, ada yang berdasarkan proyek, ada yang berdasarkan aplikasi, ada yang masih membagi sub-akun. Key untuk lingkungan pengujian dan produksi tercampur, suatu kali seorang intern meng-commit Key produksi ke repositori publik GitHub, meskipun dalam sepuluh menit sudah dicabut, tetapi sore itu seluruh tim sibuk memeriksa log pemanggilan.
Standar penagihan lebih memusingkan lagi. DeepSeek menagih berdasarkan token, sebagian model Qwen menagih input dan output secara terpisah, dan beberapa versi ERNIE masih memiliki logika penagihan berdasarkan jumlah karakter yang tersisa. Bagian keuangan meminta satu tagihan gabungan di akhir bulan, dan insinyur hanya bisa mengekspor empat file CSV secara manual lalu melakukan pemetaan. Format output streaming juga tidak seragam, ada yang mengembalikan field data SSE, ada yang membungkus dengan JSON, dan kode parsing frontend penuh dengan if else.
Apa yang sebenarnya dilakukan gateway model di tengah
Inti dari gateway model adalah satu lapisan reverse proxy ditambah lapisan adaptasi protokol, yang mengekspos antarmuka kompatibel OpenAI yang terpadu ke luar, dan menerjemahkan permintaan ke format yang dipahami masing-masing vendor ke dalam. Kami kemudian merefaktor rantai ini menggunakan kemampuan agregasi AI API SiCore TokenWorks di proyek lain, dan dampaknya cukup terasa.
Autentikasi terpadu adalah langkah pertama. Sisi bisnis hanya memegang satu Key, gateway secara internal memelihara pemetaan kredensial ke masing-masing vendor, rotasi Key, batas kuota, dan whitelist IP semuanya dilakukan di lapisan gateway. Terjemahan protokol adalah langkah kedua, mengubah array messages format OpenAI menjadi input Qwen, prompt ERNIE, dan respons dikonversi kembali secara terpadu ke struktur choices. Format chunk output streaming juga diratakan di lapisan ini, frontend hanya menulis satu set logika parsing.
Perutean distribusi menentukan permintaan pergi ke model mana. Bisa routing statis berdasarkan jenis tugas, bisa juga pemilihan dinamis berdasarkan biaya. Saat kami menguji routing multi-model token8341, kami menetapkan permintaan peninjauan kontrak untuk dirutekan secara tetap ke DeepSeek-V3, dan permintaan layanan pelanggan teks pendek dirutekan ke versi ringan Qwen, biaya pemanggilan keseluruhan turun sekitar enam puluh persen dibandingkan semuanya melalui GPT-4o. Agregasi biaya adalah langkah terakhir, gateway menandai berdasarkan label bisnis, dan di akhir bulan langsung menghasilkan tagihan terpisah, keuangan tidak perlu lagi menyusun tabel secara manual.
Beberapa saran praktis saat implementasi
Pertama, jangan memanggil SDK vendor secara langsung di kode bisnis, bahkan jika hanya mengintegrasikan satu model. Sisakan satu lapisan pembungkus tipis, selisih jumlah perubahan saat menambahkan model nanti bisa mencapai satu orde besaran. Kedua, Key harus melalui gateway atau layanan manajemen kunci, praktik hardcode di file konfigurasi cepat atau lambat akan menimbulkan masalah. Ketiga, strategi routing sebaiknya dilakukan secara statis terlebih dahulu, jalankan selama dua minggu dan setelah memiliki data pemanggilan nyata baru pertimbangkan routing biaya dinamis, jika tidak, mudah untuk merutekan permintaan penting ke model yang tidak sesuai hanya untuk menghemat beberapa sen.
Dari segi pemilihan ada dua hal: apakah kompatibel dengan SDK OpenAI, kompatibilitas berarti biaya migrasi hampir nol, cukup mengubah satu baris base_url untuk beralih; apakah mendukung penagihan berdasarkan penggunaan dan agregasi biaya, ini adalah kebutuhan pokok bagi perusahaan yang memiliki beberapa lini bisnis berbagi satu set kemampuan AI. Pendekatan SiCore TokenWorks di bidang ini adalah cakupan penuh API model besar domestik, penagihan berdasarkan penggunaan, dan dalam perbandingan proyek kami, standar tagihannya cukup jelas.
Kesimpulan dalam satu kalimat: gateway model tidak wajib, tetapi ketika Anda akan mengintegrasikan model ketiga, ia berubah dari opsional menjadiperlu. Untuk bacaan lanjutan, Anda bisa melihat dokumen spesifikasi antarmuka kompatibel OpenAI, memahami bagaimana lapisan protokol dirancang, sehingga saat menulis pembungkus sendiri bisa menghindari jalan memutar.