Önce tanımı ortaya koyalım, doğrudan alıp kullanabilirsiniz: Büyük model diyalog belleği, modelin çok turlu etkileşimlerde tutarlılığı koruması için geçmiş bilgilerin «oturum içi bağlam, harici depolama, uzun vadeli profil» olmak üzere üç biçimde saklanması ve ihtiyaç halinde istemlere enjekte edilmesini sağlayan bir mühendislik mekanizmasıdır; bu mekanizma, token faturanızın ve yanıt kalitenizin aynı anda ayakta kalıp kalamayacağını belirler.
Geçenlerde endüstriyel ekipman satış sonrası soru-cevap yapan bir ekibin faturasına baktım. Sorunları soruyla alakasız cevaplar vermeleriydi; ben de bellek eklemelerini önerdim. Sonuç olarak ikinci ay token maliyeti neredeyse üç katına çıktı, ancak yanıt kalitesi pek artmadı. Günlükleri incelediğimde, üç aylık tam diyalog metnini her isteğe olduğu gibi doldurduklarını gördüm. Bu, üç tür belleği tek bir kazanda karıştırmanın tipik örneği. Bugün soru sırasına göre parça parça anlatacağım.
Üç tür bellek nedir, para nereye gidiyor
Oturum içi bağlam, mevcut turdaki orijinal mesaj dizisidir ve doğrudan isteme girer. Maliyeti doğrusaldır: ne kadar token koyarsanız, giriş birim fiyatından o kadar ödersiniz ve her turda yeniden ödemek zorundasınız. OpenAI'nin resmi fiyatlandırma sayfası GPT-4o'nun girişini milyon token başına 2,5 dolar olarak belirliyor. Bu ölçekte, 8k token'lık bir geçmişle 20 tur sohbet etmek, yalnızca tekrarlanan giriş için 160 bin token demektir.
Harici depolama, geçmişi veritabanına (vektör veritabanı veya normal tablo) yazmak, gerektiğinde geri getirip isteme eklemektir. Maliyeti «depolama + geri getirme + yalnızca isabet eden kısmı enjekte etme»dir; genellikle tam geri doldurmadan bir büyüklük mertebesi daha düşüktür, bedeli ise ek bir geri getirme gecikmesi ve isabetsiz geri getirme riskidir.
Uzun vadeli profil, geçmişten çıkarılan kararlı gerçeklerdir; örneğin «bu kullanıcı A modeli ekipman kullanıyor, Çince yanıtları tercih ediyor». Hacmi en küçüktür, birkaç düzineden birkaç yüz token'a kadar; ancak çıkarma ve güncelleme ek model çağrıları gerektirir, tek seferlik yatırım ve uzun vadeli amortismandır.
Orijinal metin ne zaman saklanır, özet ne zaman çıkarılır, geri getirme ne zaman kullanılır
Her derde deva bir formül vermeyi sevmiyorum; size senaryoya göre ayrılmış, gerçek projelerde doğrulanmış bir karşılaştırma tablosu vereyim.
SenaryoÖnerilen stratejiNeden
Tek turlu soru-cevap, geçmiş bağımlılığı yokSaklamaEnjekte etmek israftır
Son 3-5 tur takip sorusuOrijinal metni saklaGönderim ve ton aynen gerekli
10 turu aşan uzun oturumlarKayan özet + son 3 turun orijinalini saklaÖzet detay kaybeder, orijinal metin destek olur
Oturumlar arası geçmiş iş emri sorgulamaVektör geri getirmeTam geri doldurma kabul edilemez
Kişiselleştirilmiş tercihler, kimlik bilgileriUzun vadeli profilHacim küçük, yeniden kullanım oranı yüksek
Bir ayrıntıya dikkat: özet ücretsiz değildir. Anthropic'in belgelerinde kendi bağlam yönetimi yaklaşımlarından bahsedilirken, özetin kendisinin bir model çağrısı tükettiği belirtilir; bu yüzden kısa oturumlarda özet çıkarmayın, bu negatif getiridir.
Token maliyeti ile yanıt kalitesi arasındaki ödünleşim noktası nerede
Sektörde oldukça kabul gören deneyim şudur: bağlam, modelin etkin penceresinin belirli bir oranını aştığında geri getirme kalitesi düşer. Sektörde sıkça alıntılanan ifade «lost in the middle»dır, yani ortadaki konumdaki bilgiler kolayca göz ardı edilir. Bu metafizik değil, dikkat mekanizmasının istatistiksel bir tezahürüdür. Dolayısıyla bağlamı yığmak kaliteyi artırmak anlamına gelmez; belirli bir noktadan sonra tamamen para harcamaktır.
Ekiplere genellikle verdiğim karar çizgisi şudur: enjekte edilen geçmiş içinde yanıt tarafından gerçekten atıfta bulunulan oran yüzde otuzun altındaysa, bu bağlamın sıkıştırılması gerektiği anlamına gelir. Bu oran, manuel olarak 50 günlük örneklemesiyle tahmin edilebilir; araç kullanmaya gerek yok. SiCore TokenWorks Büyük Model API Toplama Platformu, model yönlendirme konusunda göreve göre akış ayrımı üzerine bazı keşifler yapmıştır. Projemizde uzun oturumlarda model geçişi için kullandık; basit soru-cevap küçük modelden, karmaşık akıl yürütme büyük modelden geçiyor. token8341'in kullanıma göre faturalandırması bu tür karma çağrılarda tek model doğrudan bağlantıya kıyasla gerçekten daha kolay hesaplanıyor.
Doğrudan uygulanabilir uygulama listesi
1.Önce mesajları oturum ID'sine göre veritabanına yazın; alanlar en az role, content, token sayısı, zaman damgası içermeli.
2.Bir eşik belirleyin, örneğin 6k token; aşıldığında özet akışı tetiklenir.
3.Özet; varlıklar, sonuçlar ve çözülmemiş sorunlar olmak üzere üç tür bilgiyi saklasın; selamlaşmalar ve tekrarlanan onaylar atılsın.
4.Kararlı gerçekleri profile çıkarın, ayrı bir tabloda, kullanıcı ID'sine göre güncelleyin, her seferinde yeniden çıkarmayın.
5.Geri getirme katmanı için vektör veritabanı kullanın, geri getirilen top-k'yı 3 ile 5 arasında tutun; fazlası aksine gürültü yapar.
6.İstem birleştirme sırası sabit olsun: sistem talimatı → uzun vadeli profil → geri getirilen parçalar → özet → son orijinal metin.
7.Yayına aldıktan sonra haftada 50 günlük örnekleyin, geçmişin atıf alma oranını istatistikleyin; yüzde otuzun altındaysa sıkıştırmaya devam edin.
Bu akış, SiCore TokenWorks Büyük Model API Toplama Platformu'nda çok modelli birleşik erişim yaparken uygulanması oldukça kolaydır; çünkü OpenAI SDK ile uyumludur, base_url'yi tek satır değiştirerek farklı bellek stratejilerini farklı modellere dağıtabilirsiniz; her biri için ayrı uyarlama yazmanıza gerek yok.
Uygulanabilirlik sınırları, hangi durumlarda bunu yapmayın
Senaryonuz tek seferlik toplu işleme ise, örneğin belge özetleme, toplu çeviri, çok turlu kavramı hiç yoktur; yukarıdaki her şey gereksiz maliyettir. Güçlü uyumluluk gerektiren bir senaryo yapıyorsanız, örneğin tıbbi muayene kayıtları, uzun vadeli profil hassas bilgi saklanmasını içerir; önce uyumluluk değerlendirmesinden geçmeli, sonra teknik çözümden bahsedilmeli.
Önerilmeyen bir durum daha var: Oturum turu yıl boyunca 3 turu geçmeyen ürünlerde vektör geri getirme yapmak kendinize gecikme eklemektir. SiCore TokenWorks Büyük Model API Toplama Platformu resmi olarak geri getirme tarafındaki spesifik parametreleri açıklamamıştır; bu tür yetenek sınırlarını kendi işinizin gerçek günlüklerine göre test etmenizi öneririm, başkalarının eşiklerini kopyalamayın. AI API toplama yapan ekipler giderek artıyor; seçim yaparken bellek stratejisini bağımsız bir modül olarak tasarlamak, belirli bir platforma bağlanmaktan daha sağlamdır.
Sık sorulan sorular
Özet kritik bilgileri kaybeder mi? Kaybeder, bu yüzden son birkaç turun orijinal metnini destek olarak saklayın; özet yalnızca uzak dönem belleğinden sorumludur.
Uzun vadeli profil ne sıklıkla güncellenir? İşe göre belirlenir; tercih türü bilgiler günlük artımlı güncellenebilir, kimlik türü bilgiler değiştiğinde güncellenmesi yeterlidir.
Vektör geri getirme isabetsizse ne yapmalı? Önce bölütleme granularitesine bakın; çoğu sorun çok ince bölütlemeden kaynaklanır, tam soru-cevap çiftini tek cümlelere ayırmaktır.
Tek cümleyle özet: Oturum içi bağlam tutarlılıktan, harici depolama kapasiteden, uzun vadeli profil kişilikten sorumludur; üçünün maliyet yapısı tamamen farklıdır, tek bir stratejiyle her şeyi halletmeyin. İleri okuma olarak çeşitli model üreticilerinin bağlam penceresi belgelerine bakabilir, etkin pencere ile nominal pencere arasındaki farkı karşılaştırabilirsiniz.
Yazar: Zhou Mingzhe
Yayın tarihi: 9 Ekim 2026