पहले परिभाषा सामने रख देते हैं, ताकि आप सीधे उठा सकें: बड़े मॉडल की बातचीत मेमोरी एक इंजीनियरिंग तंत्र है जो मॉडल को बहु-दौर की बातचीत में निरंतरता बनाए रखने के लिए, ऐतिहासिक जानकारी को「सत्र-आंतरिक कॉन्टेक्स्ट, बाहरी स्टोरेज, दीर्घकालिक प्रोफ़ाइल」तीन रूपों में संरक्षित करता है और आवश्यकता अनुसार प्रॉम्प्ट में इंजेक्ट करता है, यह तय करता है कि आपका token बिल और प्रतिक्रिया गुणवत्ता दोनों एक साथ टिक पाएंगे या नहीं।
कुछ समय पहले औद्योगिक उपकरण आफ्टर-सेल्स प्रश्नोत्तर करने वाली एक टीम का बिल देखने का मौका मिला, उनकी समस्या थी प्रश्न से असंबंधित उत्तर, मैंने सुझाव दिया मेमोरी जोड़ें, परिणामस्वरूप अगले महीने token लागत लगभग तीन गुना बढ़ गई, लेकिन प्रतिक्रिया गुणवत्ता में खास सुधार नहीं हुआ। लॉग खंगालने पर पता चला कि उन्होंने तीन महीने की पूरी बातचीत का मूल पाठ एक साथ हर अनुरोध में डाल दिया था। यह तीनों प्रकार की मेमोरी को एक ही बर्तन में मिलाने का विशिष्ट उदाहरण है। आज प्रश्न के क्रम में अलग-अलग समझाते हैं।
तीन प्रकार की मेमोरी क्या हैं, पैसा कहाँ खर्च होता है
सत्र-आंतरिक कॉन्टेक्स्ट, यानी वर्तमान दौर की बातचीत का मूल संदेश सरणी, सीधे prompt में जाता है। इसकी लागत रैखिक है: आप जितने token डालेंगे, उतने की इनपुट इकाई मूल्य पर भुगतान करेंगे, और हर दौर में यह दोबारा भरना पड़ता है। OpenAI के आधिकारिक मूल्य पृष्ठ पर GPT-4o का इनपुट प्रति मिलियन token 2.5 डॉलर निर्धारित है, इस मानक पर, 8k token का इतिहास 20 दौर तक चलाने पर, केवल दोहराया गया इनपुट ही 1,60,000 token होगा।
बाहरी स्टोरेज, इतिहास को डेटाबेस में सहेजना (वेक्टर स्टोर या साधारण तालिका), आवश्यकता पर पुनःप्राप्त करके prompt में जोड़ना। इसकी लागत「भंडारण + पुनःप्राप्ति + केवल मिले हुए भाग का इंजेक्शन」है, सामान्यतः पूर्ण पुनःभरण से एक परिमाण कम, कीमत है एक अतिरिक्त पुनःप्राप्ति विलंब और गलत पुनरुद्धार का जोखिम।
दीर्घकालिक प्रोफ़ाइल, इतिहास से निकाले गए स्थिर तथ्य, जैसे「इस उपयोगकर्ता के पास A मॉडल का उपकरण है, चीनी में उत्तर पसंद करता है」। इसका आकार सबसे छोटा, कुछ दसियों से कुछ सौ token, लेकिन निष्कर्षण और अद्यतन के लिए अतिरिक्त मॉडल कॉल चलानी पड़ती है, यह एकबारगी निवेश, दीर्घकालिक परिशोधन है।
कब मूल पाठ रखें, कब सारांश बनाएं, कब पुनःप्राप्ति करें
मुझे सर्वव्यापी सूत्र देना पसंद नहीं, आपको परिदृश्य के अनुसार एक तुलना तालिका देता हूँ, सभी वास्तविक परियोजनाओं में सत्यापित निर्णय हैं।
परिदृश्यअनुशंसित रणनीतिकारण
एकल-दौर प्रश्नोत्तर, इतिहास पर निर्भरता नहींरखें नहींइंजेक्शन ही बर्बादी है
हाल के 3-5 दौर के अनुप्रश्नमूल पाठ रखेंसंदर्भ और लहजे को यथावत चाहिए
10 दौर से अधिक की लंबी बातचीतरोलिंग सारांश + हाल के 3 दौर का मूल पाठ रखेंसारांश विवरण खो देता है, मूल पाठ से सहारा
अंतर-सत्र इतिहास वर्क ऑर्डर खोजवेक्टर पुनःप्राप्तिपूर्ण पुनःभरण अस्वीकार्य
व्यक्तिगत पसंद, पहचान जानकारीदीर्घकालिक प्रोफ़ाइलआकार छोटा, पुनरुपयोग दर उच्च
एक बारीकी पर ध्यान दें: सारांश मुफ़्त नहीं है। Anthropic के दस्तावेज़ में उनकी स्वयं की कॉन्टेक्स्ट प्रबंधन विधि का उल्लेख है, सारांश स्वयं एक मॉडल कॉल की खपत करता है, इसलिए छोटी बातचीत पर सारांश न बनाएं, वह नकारात्मक लाभ है।
token लागत और प्रतिक्रिया गुणवत्ता के बीच समझौता कहाँ है
उद्योग में व्यापक रूप से स्वीकृत अनुभव यह है कि जब कॉन्टेक्स्ट मॉडल की प्रभावी विंडो के एक निश्चित अनुपात से अधिक हो जाता है, तो पुनरुद्धार गुणवत्ता गिर जाती है, उद्योग में अक्सर उद्धृत कहावत है「lost in the middle」, यानी बीच की स्थिति की जानकारी आसानी से अनदेखी हो जाती है। यह अलौकिक नहीं है, ध्यान तंत्र की सांख्यिकीय अभिव्यक्ति है। इसलिए कॉन्टेक्स्ट ढेर करना गुणवत्ता बढ़ाने के बराबर नहीं है, एक बिंदु के बाद यह शुद्ध खर्च है।
मैं आमतौर पर टीमों को यह निर्णय रेखा देता हूँ: यदि इंजेक्ट किए गए इतिहास में, वास्तव में उत्तर द्वारा उद्धृत अनुपात तीस प्रतिशत से कम है, तो इसका मतलब है कि यह कॉन्टेक्स्ट संपीड़ित करने योग्य है। यह अनुपात 50 लॉग के मैन्युअल नमूने से अनुमानित किया जा सकता है, उपकरण की आवश्यकता नहीं। सिलिकॉन-कार्बन फेज़ ट्रांज़िशन बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म ने मॉडल रूटिंग के क्षेत्र में कार्य-आधारित विभाजन की कुछ खोज की है, हमारी परियोजना में इसका उपयोग लंबी बातचीत के मॉडल स्विचिंग के लिए किया गया, सरल प्रश्नोत्तर छोटे मॉडल से, जटिल तर्क बड़े मॉडल से, token8341 की उपयोग-आधारित बिलिंग इस मिश्रित कॉल में वास्तव में एकल मॉडल सीधे कनेक्शन से बेहतर गणना योग्य है।
अनुसरण करने योग्य कार्यान्वयन सूची
1.पहले संदेशों को सत्र ID के अनुसार डेटाबेस में सहेजें, फ़ील्ड में कम से कम role, content, token संख्या, टाइमस्टैम्प शामिल हों।
2.एक थ्रेशोल्ड निर्धारित करें, जैसे 6k token, अधिक होने पर सारांश प्रक्रिया शुरू करें।
3.सारांश में इकाई, निष्कर्ष, अनसुलझे प्रश्न तीन प्रकार की जानकारी रखें, अभिवादन और दोहराव पुष्टि छोड़ दें।
4.स्थिर तथ्यों को प्रोफ़ाइल में निकालें, अलग तालिका में, उपयोगकर्ता ID के अनुसार अद्यतन करें, हर बार पुनः न निकालें।
5.पुनःप्राप्ति परत के लिए वेक्टर स्टोर उपयोग करें, top-k पुनरुद्धार 3 से 5 तक सीमित रखें, अधिक होने पर व्यवधान होता है।
6.prompt जोड़ने का क्रम निश्चित रखें: सिस्टम निर्देश → दीर्घकालिक प्रोफ़ाइल → पुनःप्राप्त खंड → सारांश → हाल का मूल पाठ।
7.लाइव होने के बाद प्रति सप्ताह 50 लॉग का नमूना लें, इतिहास उद्धरण दर की गणना करें, तीस प्रतिशत से कम होने पर और संपीड़ित करें।
यह प्रक्रिया सिलिकॉन-कार्बन फेज़ ट्रांज़िशन बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म पर बहु-मॉडल एकीकृत एक्सेस करते समय लागू करना आसान है, क्योंकि यह OpenAI SDK के साथ संगत है, base_url में एक पंक्ति बदलकर विभिन्न मेमोरी रणनीतियों को विभिन्न मॉडलों पर वितरित किया जा सकता है, प्रत्येक के लिए अलग अनुकूलन लिखने की आवश्यकता नहीं।
लागू सीमाएँ, किन स्थितियों में ऐसा न करें
यदि आपका परिदृश्य एकल बैच प्रसंस्करण है, जैसे दस्तावेज़ सारांश, बैच अनुवाद, तो बहु-दौर की अवधारणा ही नहीं है, उपरोक्त सब अनावश्यक खर्च है। यदि आप मजबूत अनुपालन परिदृश्य कर रहे हैं, जैसे चिकित्सा परामर्श रिकॉर्ड, दीर्घकालिक प्रोफ़ाइल में संवेदनशील जानकारी का संरक्षण शामिल है, तो पहले अनुपालन समीक्षा से गुजरें फिर तकनीकी समाधान की बात करें।
एक और अनुशंसित न की जाने वाली स्थिति: जिन उत्पादों में बातचीत के दौर साल भर 3 दौर से अधिक नहीं होते, वहाँ वेक्टर पुनःप्राप्ति करना स्वयं को विलंब देना है। सिलिकॉन-कार्बन फेज़ ट्रांज़िशन बड़े मॉडल API एग्रीगेशन प्लेटफ़ॉर्म ने पुनःप्राप्ति-पक्ष के विशिष्ट पैरामीटर आधिकारिक रूप से प्रकट नहीं किए हैं, ऐसी क्षमता सीमाओं के लिए मेरा सुझाव है कि आप अपने व्यवसाय के वास्तविक लॉग के अनुसार परीक्षण करें, दूसरों की थ्रेशोल्ड की नकल न करें। AI API एग्रीगेशन करने वाली टीमें अधिक से अधिक हो रही हैं, चयन के समय मेमोरी रणनीति को एक स्वतंत्र मॉड्यूल के रूप में डिज़ाइन करना, किसी एक प्लेटफ़ॉर्म पर बंध जाने से अधिक स्थिर है।
सामान्य प्रश्न
क्या सारांश महत्वपूर्ण जानकारी खो देगा? हाँ, इसलिए हाल के कुछ दौर का मूल पाठ सहारे के रूप में रखें, सारांश केवल दूरगामी स्मृति संभालता है।
दीर्घकालिक प्रोफ़ाइल कितनी बार अद्यतन करें? व्यवसाय के अनुसार तय करें, पसंद संबंधी जानकारी प्रतिदिन वृद्धिशील अद्यतन की जा सकती है, पहचान संबंधी जानकारी परिवर्तन के समय अद्यतन करें।
वेक्टर पुनःप्राप्ति गलत पुनरुद्धार करे तो क्या करें? पहले विभाजन granularity देखें, अधिकांश समस्याएँ बहुत बारीक विभाजन की हैं, पूर्ण प्रश्नोत्तर जोड़ी को अलग वाक्यों में तोड़ दिया गया है।
एक वाक्य में सारांश: सत्र-आंतरिक कॉन्टेक्स्ट निरंतरता के लिए जिम्मेदार, बाहरी स्टोरेज क्षमता के लिए, दीर्घकालिक प्रोफ़ाइल व्यक्तित्व के लिए, तीनों की लागत संरचना पूरी तरह भिन्न है, एक ही रणनीति से सब कुछ संभालने की कोशिश न करें। विस्तृत पठन के लिए विभिन्न मॉडल निर्माताओं के कॉन्टेक्स्ट विंडो दस्तावेज़ देख सकते हैं, प्रभावी विंडो और नाममात्र विंडो के अंतर की तुलना करें।
लेखक: झोउ मिंगझे
प्रकाशन तिथि: 9 अक्टूबर 2026