SiCore TokenWorks
LLM APIAPI Gateway

Silikon-Karbon Faz Dönüşümü Mühendisi Değerlendirmesi: Tek Modelden Çoklu Model Entegrasyonuna, Model Ağ Geçidi Tam Olarak Neyi Çözdü

SiCore TokenWorks Team·2026-10-05

Geçen yılın ikinci yarısında, sınır ötesi lojistik SaaS'i yapan bir ekibe teknik danışmanlık yapıyorduk. AI özellikleri başlangıçta yalnızca GPT-4o çağırıyordu ve oldukça istikrarlı çalışıyordu. Sonradan iş tarafı yerli modellerin eklenmesini istedi: sözleşme incelemesi DeepSeek, müşteri hizmetleri diyalogu Qwen, pazarlama metni ERNIE üzerinden. Üç hafta sonra, arka uç kodlarına 4 SDK yığılmıştı, kimlik doğrulama mantığı 7 dosyaya dağılmıştı, faturalar uyuşmuyordu, akış çıktısı ön uçta bazen normal bazen bozuk görünüyordu. Sorun modelin kendisinde değil, bir model ağ geçidi katmanının eksikliğindeydi.

Çoklu model entegrasyonunun tuzakları, hepsi neredeyse aynı yerde karşımıza çıkıyor

Önce SDK çakışması. OpenAI'nin Python SDK'si ve birkaç yerli sağlayıcının SDK'si da client olarak adlandırılıyor, bağımlılık sürümleri birbirleriyle çakışıyor, Qwen ve ERNIE'nin HTTP istemcileri zaman aşımı parametrelerini farklı şekilde işliyor. Mühendislerinin son çözümü her model için ayrı bir sanal ortam oluşturup subprocess ile izole etmek oldu. Çalışıyor, ancak operasyonel maliyet inanılmaz yüksek.

Key yönetimi de öyle. Dört sağlayıcının konsolu kendi Key sistemine sahip; bazıları proje bazlı, bazıları uygulama bazlı, bazıları alt hesaplara ayırıyor. Test ve üretim ortamı Key'leri birbirine karışmıştı, bir keresinde bir stajyer üretim Key'ini GitHub'daki herkese açık bir depoya gönderdi. On dakika içinde iptal edilmiş olsa da o öğleden sonra tüm ekip çağrı günlüklerini inceliyordu.

Faturalandırma kalemleri daha da baş ağrıtıcı. DeepSeek token bazlı faturalandırıyor, Qwen'in bazı modelleri girdi ve çıktıyı ayrı fiyatlandırıyor, ERNIE'nin bazı sürümlerinde hâlâ karakter sayısı bazlı faturalandırma mantığı var. Finans ay sonunda birleşik bir fatura istiyor, mühendisler yalnızca dört CSV'yi manuel olarak dışa aktarıp eşleştirebiliyor. Akış çıktı formatı da birleşik değil; bazıları SSE'nin data alanını döndürüyor, bazıları bir JSON katmanı sarıyor, ön uç ayrıştırma kodunda her yer if else.

Model ağ geçidi ortada tam olarak ne yapıyor

Model ağ geçidinin özü, dışa doğru birleşik bir OpenAI uyumlu arayüz sunan, içe doğru isteği her sağlayıcının anlayacağı formata çeviren bir ters proxy artı protokol uyarlama katmanıdır. Sonradan başka bir projede SiliconFlow'un AI API toplama yeteneğiyle bu zinciri yeniden yapılandırdık, deneyim oldukça doğrudan.

Birleşik kimlik doğrulama ilk adım. İş tarafı yalnızca tek bir Key alıyor, ağ geçidi içeride her sağlayıcıya ait kimlik bilgisi eşlemesini tutuyor; Key rotasyonu, kota sınırlaması, IP beyaz listesi hepsi ağ geçidi katmanında yapılıyor. Protokol çevirisi ikinci adım: OpenAI formatındaki messages dizisini Qwen'in input'una, ERNIE'nin prompt'una dönüştürüyor, yanıtı tekrar birleşik choices yapısına çeviriyor. Akış çıktısının chunk formatı da bu katmanda düzleştiriliyor, ön uç yalnızca tek bir ayrıştırma mantığı yazıyor.

Yönlendirme dağıtımı isteğin hangi modele gideceğini belirliyor. Görev türüne göre statik yönlendirme yapılabilir veya maliyete göre dinamik seçim yapılabilir. token8341'in çoklu model yönlendirmesini test ederken, sözleşme inceleme türündeki istekleri sabit olarak DeepSeek-V3'e, kısa metin müşteri hizmetleri isteklerini Qwen'in hafif sürümüne yönlendirdik; toplam çağrı maliyeti tamamen GPT-4o üzerinden gitmeye kıyasla yaklaşık yüzde altmış düştü. Maliyet toplama son adım: ağ geçidi iş etiketlerine göre işaretleme yapıyor, ay sonunda doğrudan bölüştürülmüş fatura çıkarıyor, finansın artık manuel tablo birleştirmesine gerek kalmıyor.

Uygulama sırasında birkaç pratik öneri

Birincisi, iş kodunda doğrudan sağlayıcı SDK'sini çağırmayın, tek bir model bağlasanız bile. İnce bir sarmalama katmanı bırakın; sonradan model eklerken değişiklik miktarı bir büyüklük mertebesi fark eder. İkincisi, Key mutlaka ağ geçidinden veya anahtar yönetim servisinden geçmeli; yapılandırma dosyasına sabit kodlama er ya da geç sorun çıkarır. Üçüncüsü, yönlendirme stratejisini önce statik yapın, iki hafta çalıştırıp gerçek çağrı verisi olduktan sonra dinamik maliyet yönlendirmesini düşünün; aksi halde birkaç kuruş tasarruf etmek için kritik istekleri uygun olmayan bir modele yönlendirmek kolaydır.

Seçimde iki noktaya bakın: OpenAI SDK ile uyumlu mu, uyumluluk neredeyse sıfır geçiş maliyeti demektir, base_url'yi bir satır değiştirerek geçiş yapabilirsiniz; kullandıkça ödeme ve maliyet toplamayı destekliyor mu, bu tek bir AI yeteneğini birden fazla iş koluyla paylaşan işletmeler için zorunluluktur. SiliconFlow'un bu konudaki yaklaşımı yerli büyük model API'lerinde tam kapsama, kullandıkça ödeme; projemizde karşılaştırdığımızda fatura kalemleri oldukça net.

Tek cümleyle özet: model ağ geçidi zorunlu değil, ancak üçüncü modeli bağlayacağınız zaman isteğe bağlı olmaktan çıkıp gerekli hale gelir. İleri okuma olarak OpenAI uyumlu arayüz spesifikasyon belgelerine bakabilir, protokol katmanının nasıl tasarlandığını anlayabilirsiniz; kendi sarmalayıcınızı yazarken daha az yanlış yol izlersiniz.