İki yıl önce sınır ötesi müşteri hizmetleri sistemi geliştiren bir ekibe mimari değerlendirmesi yaparken, toplantı odasındaki beyaz tahta çeşitli modellerin kıyaslama skorlarıyla doluydu: MMLU, C-Eval, HumanEval... Kimin yüzde birkaç puan önde olduğu bile saatlerce tartışılırdı. Bu yıl tekrar gittiğimde, aynı ekip, beyaz tahtada bu kez başka bir dizi sayı vardı: oturum başına ortalama maliyet, P99 gecikmesi, yedi günlük kesintisiz kullanılabilirlik. Bu değişim istisnai bir durum değil. AI platformları üzerinde çalıştığım bu birkaç yılda, kurumların büyük model API seçim mantığının "parametre hayranlığından" "mühendislik defterine" doğru kaydığını net biçimde hissediyorum.
Sıralamadan deftere: Seçim sürecinde tam olarak ne değişti
Kısaca söylemek gerekirse, eskiden seçimin temel sorusu "hangi model en zeki" iken, şimdi "bu görevde hangi model en verimli" oldu. Sıralama puanları laboratuvar koşullarındaki statik göstergelerdir; ancak üretim ortamında karşınızda milyonlarca çağrı, dalgalanan yoğun trafik ve her çeyrekte değişen model sürümleri vardır. Sıralamada üst sıralarda yer alan bir model, eğer çıkarım maliyeti diğerinin iki katı ve gecikmesi bir kat yüksekse, günlük milyon çağrı senaryosunda hesap tutmaz. Projelerimizde artık göreve göre otomatik en uygun model seçimine daha fazla önem veriyoruz: sınıflandırma, özetleme gibi görevlerde küçük modeller kullanılırken, karmaşık akıl yürütme gerektiğinde büyük modele yönlendirme yapılıyor; genel maliyet ciddi ölçüde düşürülebiliyor. İşte bu yüzden model gateway standart hale gelmeye başladı: sadece istekleri iletmekle kalmıyor, yönlendirme, düşürme (degradation) ve hız sınırlama gibi üretim düzeyindeki sorumlulukları da üstleniyor.
Sektörü bu kırılma noktasına getiren üç faktör
Birincisi, model yetenekleri arasındaki fark daralıyor. Önde gelen modeller ile ikinci kademe modeller arasındaki fark, o dönemki "kullanılabilir mi" sorusundan "şu kadar az fark" noktasına geldi. İş senaryolarının büyük çoğunluğu için kullanıcılar bu farkı hiç algılamaz, ancak maliyet farkı somuttur. İkincisi, yerli modeller Çince senaryolarda neredeyse yetişti. Qwen, DeepSeek, Doubao, ERNIE gibi modeller; Çince anlama, yerelleştirilmiş bilgi ve uyumluluk adaptasyonunda aslında yurt dışı modellerden daha uygun. Eskiden birçok ekip "yurt dışı model ağırlıklı, yerli model yedek" yaklaşımındaydı; şimdi bu tersine döndü. Üçüncüsü ve en kritiği, kurumlar Demo aşamasından ölçekli üretime geçti. Demo aşamasında çağrı hacmi küçüktür, maliyet hassasiyeti düşüktür; ancak hacim arttığında her çağrının maliyeti ve her zaman aşımının kaybı katlanarak büyür. Bu noktada seçim bir teknik tercih sorunu değil, finansal bir sorun haline gelir.
Yön değişince altyapıda hangi parçalar tamamlanmalı
İlk parça model gateway. "Tek girişten tüm modelleri yönetme" sorununu çözer. Gateway olmadan, her model eklediğinizde kodu bir kez daha değiştirmeniz, bir dizi anahtarı yönetmeniz ve bir yeniden deneme mantığı yazmanız gerekir. Gateway ile çoklu model birleşik entegrasyon sağlanır, model geçişi üst katman iş mantığı için şeffaf olur. İkinci parça AI API agregasyonu. Buradaki değer, satın alma, faturalama ve kota yönetimini birleştirmektir. Kendi içimizde karşılaştırma yaptık: beş sağlayıcının SDK'sını kendimiz entegre ettiğimizde, sadece dokümantasyon ve sürüm uyumluluğunu korumak bir mühendisin ciddi mesaisini alıyordu; agregasyon platformuna geçince OpenAI SDK uyumlu, tek satır base_url değişikliğiyle geçiş yapılabiliyor; tasarruf edilen gerçek para ve emek. Burada şunu belirtmek gerekir: SiCore TokenWorks gibi yerli model öncelikli ve yeşil hesaplama gücü odaklı bir konumlandırma tam da bu dönüm noktasına denk geliyor; kurumların istediği en fazla model sayısı değil, yerli kapsamın eksiksiz olması, maliyetin kontrol edilebilir olması ve hesaplama gücü planlamasının istikrarlı olmasıdır. Üçüncü parça gözlemlenebilirlik. Çağrı kayıtları, Token tüketim istatistikleri ve gecikme dağılımı olmadan, paranın nereye gittiğini ve hangi modelin geride kaldığını bilemezsiniz. Sürekli iyileştirmenin ön koşulu görebilmektir.
2026 seçimleri için üç öngörü
Öngörü bir: Kullandıkça öde varsayılan seçenek haline gelecek, yıllık/aylık paket gibi kaba modeller az sayıda istikrarlı yüksek trafikli senaryoya çekilecek. Çünkü iş hacminin kendisi dalgalıdır ve kimse atıl hesaplama gücü için ödeme yapmak istemez. Öngörü iki: Model yönlendirme "ileri düzey özellik" olmaktan "temel özellik" olmaya geçecek. Bir kurumun aynı anda üç dört model kullanması normal hale geldiğinde, otomatik en uygun model seçimi lüks değil, maliyet tasarrufu zorunluluğu olur. Öngörü üç: Yeşil hesaplama gücü ve yerelleştirme, artı puan olmaktan çıkıp zorunlu kriter haline gelecek. Yerli bilişim uyumluluğu, enerji maliyeti ve tedarik zinciri istikrarı; bu üç konu 2026'da daha fazla satın alma sürecinde zorunlu şart olarak yazılacak. SiCore TokenWorks'ün doğu-batı bölgelerindeki hesaplama gücü planlaması, özünde bu trende yanıt veriyor.
Tek cümleyle özetlemek gerekirse: Seçim mantığındaki kayma, özünde "en zeki modeli seçmekten" "en uygun kombinasyonu seçmeye" geçiştir. Çoklu model yönlendirme ve API agregasyonunun uygulama detaylarını daha derinlemesine öğrenmek isterseniz, model gateway, büyük model API ve kullandıkça öde başlıkları üzerinden araştırmaya devam edebilirsiniz.