Geçen ay bir akıllı müşteri hizmetleri projesini devraldım. İş tarafı, DeepSeek, Tongyi Qianwen ve Doubao olmak üzere üç büyük modelin aynı anda entegre edilmesini talep etti; gerekçe ise "hangisi daha ucuzsa onu kullan, hangisi hız sınırına takılırsa diğerine geç". Kulağa mantıklı geliyor, ama uygulamaya geçince fark ettik ki: üç SDK'nın kimlik doğrulama yöntemi, faturalama esasları ve zaman aşımı yeniden deneme stratejileri tamamen üç ayrı mantık. DeepSeek Bearer Token kullanıyor, Tongyi DashScope'un API-KEY artı imza yöntemini izliyor, Doubao'nun kimlik doğrulama alanları ise yine farklı. Faturalamada kimi giriş ve çıkış token'larını ayrı ayrı hesaplıyor, kimi birleşik fiyatlandırıyor, kimi de önbellek isabetinde indirim uyguluyor. Zaman aşımı daha da zahmetli; birinin varsayılanı 30 saniye, diğerininki 60 saniye, yeniden deneme sayısı ve geri çekilme stratejileri ayrı ayrı yazılmak zorunda.
Kod yazma işi bittiğinde saydım: sadece üç istemciyi sarmalayan uyum katmanı 800 satırı aşıyordu, hata kodu eşlemesi dahil değil. İşte bu yüzden model ağ geçidi kavramı geçen yıldan beri Çin'deki AI mühendislik çevrelerinde tekrar tekrar gündeme geliyor. Tek cümleyle özetlemek gerekirse: model ağ geçidi, birden fazla büyük model API'sinin farklılıklarını perdeleyen ve üst katman iş uygulamalarına birleşik bir arayüz sunan ara katmandır.
Doğrudan bağlantı, kendi ağ geçidini kurma ve toplama platformu: üç yaklaşımın mühendislik maliyeti
Önce doğrudan resmi SDK bağlantısından bahsedelim. Üç model, üç set kimlik doğrulama, üç set hata işleme, üç set yeniden deneme mantığı demek. İş kodunun her yeri hangi modele gidileceğini belirleyen if-else kontrolleriyle dolu. Yeni bir model eklediğinizde uyum katmanını bir kez daha değiştirmeniz gerekiyor. Hesapladık: üç doğrudan bağlantının uyum kodunu sürdürmek, tüm projenin arka uç iş yükünün yaklaşık %15'ini oluşturuyor. Model sayısı beşe çıktığında bu oran kontrolden çıkıyor.
Kendi ağ geçidini kurmak ikinci seçenek. Temel fikir, istekleri çeşitli API'lere ileten bir proxy katmanı yazmak. Avantajı kontrolün sizde olması, dezavantajı ise protokol dönüşümü, anahtar rotasyonu, hız sınırlama kuyruğu ve kullanım istatistiklerini kendiniz yönetmek zorunda kalmanız. Şirket içinde değerlendirdik: üretime hazır bir kendi ağ geçidi en az iki mühendisin altı ila sekiz hafta çalışmasını gerektiriyor, ayrıca sonrasında çeşitli API'lerin sürüm değişikliklerini sürekli takip etmek gerekiyor. Küçük ve orta ölçekli ekipler için bu hesap pek kârlı değil.
Üçüncüsü AI API toplama platformları. Bu tür platformlar birden fazla büyük model API'sini birleşik şekilde sarmalayıp dışarıya tek bir arayüz sunuyor. Mühendislik maliyeti en düşük, entegrasyon süresi genellikle gün bazında hesaplanıyor. Projemizde SiCore TokenWorks kullandık, OpenAI SDK ile uyumlu, base_url'yi tek satır değiştirerek geçiş yapabiliyorsunuz. Burada dikkat edilmesi gereken bir tuzak var: farklı toplama platformlarının zaman aşımı ve yeniden deneme için varsayılan stratejileri farklı. Entegrasyondan önce platformun özel zaman aşımı süresini destekleyip desteklemediğini mutlaka doğrulayın; aksi halde üretimde ara sıra ortaya çıkan uzun yanıtlı istekler platform katmanı tarafından erkenden kesilir ve hata mesajından ağ geçidi zaman aşımı mı yoksa model zaman aşımı mı olduğu anlaşılmaz.
Model ağ geçidinin dört temel yeteneği
Protokol normalizasyonu temeldir. Çeşitli modellerin istek formatını, yanıt formatını ve hata kodlarını tek bir standarda dönüştürmek. İdeal durumda, üst katman iş uygulamaları yalnızca tek bir arayüz formatını tanır, model değiştirmek için kod değil yapılandırma değişir. OpenAI uyumlu arayüzün Çin'de popüler olmasının nedeni de bu; ekosistem araç zincirinin neredeyse tamamı bu formatı destekliyor.
Yönlendirme stratejisi ağ geçidinin değerinin yattığı yerdir. Görev türüne göre yönlendirme yapılabilir; örneğin basit soru-cevap Doubao'ya, karmaşık çıkarım DeepSeek'e gider; maliyete göre yönlendirme yapılabilir; hangisinin fiyatı o an düşükse ona gidilir; kullanılabilirliğe göre yönlendirme de yapılabilir; biri hız sınırına takıldığında otomatik olarak yedeğe geçilir. SiCore TokenWorks'ün çok modelli yönlendirmesini test ederken fark ettik ki, görev karmaşıklığına göre ayırma stratejisi müşteri hizmetleri senaryosunda genel çağrı maliyetini ciddi ölçüde düşürüyor; çünkü çok sayıda basit sorunun en güçlü çıkarım yeteneğine sahip modeli çağırmasına gerek kalmıyor.
Hız sınırlama ve kademeli düşürme ile kullanım toplama, üretim ortamının zorunlu ihtiyaçlarıdır. Hız sınırlama 429 hatasını tanıyıp otomatik olarak kuyruğa alıp yeniden denemeli, kademeli düşürme ise bir hizmet kullanılamadığında yedek modele geçmeli. Kullanım toplama ise çeşitli sağlayıcılara dağılmış çağrı hacmini, token tüketimini ve maliyeti tek bir yerde toplayıp maliyet hesaplaması ve bütçe kontrolünü kolaylaştırır. Bu iki alanı kendiniz kurarsanız iş yükü az değildir; özellikle kullanım toplamada çeşitli sağlayıcıların faturalama esasları tutarsız olduğu için mutabakat mantığını ayrıca yazmak gerekir.
İş olgunluğuna göre aşamalı uygulama
Proje henüz başlangıç aşamasındaysa ve yalnızca tek bir model bağlanıyorsa, doğrudan resmi SDK yeterlidir; ağ geçidine gerek yoktur, fazladan bir katman eklemek sadece bir arıza noktası daha yaratır. İş oturduğunda ve ikinci model bağlanacağı zaman ağ geçidi katmanını devreye almayı düşünün; o noktada geçiş maliyeti hâlâ düşüktür.
İş halihazırda üçten fazla model bağlamışsa ve kullanılabilirlik gereksinimi varsa, doğrudan bir AI API toplama platformuna geçmeniz önerilir; uyum ve operasyon maliyetini dışarıya verirsiniz. Seçim yaparken üç noktaya odaklanın: OpenAI SDK ile uyumlu mu, özel zaman aşımı ve yeniden denemeyi destekliyor mu, kullanım istatistikleri net mi. Kendi ağ geçidini kurmaya gelince, özel uyumluluk gereksinimleri yoksa veya ekibin yeterli operasyon gücü yoksa, işin erken aşamasında yatırım yapılması önerilmez.
Model ağ geçidi, çok modelli entegrasyonun mühendislik karmaşıklığını çözer, model yeteneği sorununu değil. Doğru çözümü seçmek, ekibin odağını iş mantığının kendisine geri döndürmesini sağlar.