Najpierw podam definicję, żebyś mógł ją od razu wykorzystać: pamięć konwersacji dużego modelu to zestaw mechanizmów inżynieryjnych służących do zachowania spójności modelu w interakcjach wieloturażowych poprzez przechowywanie informacji historycznych w trzech formach — „kontekst w obrębie sesji, pamięć zewnętrzna, długoterminowy profil" — i wstrzykiwanie ich do promptu w razie potrzeby, co decyduje o tym, czy twój rachunek za tokeny i jakość odpowiedzi mogą jednocześnie się obronić.
Jakiś czas temu pomagałem zespołowi zajmującemu się pytaniami i odpowiedziami w serwisie posprzedażowym urządzeń przemysłowych przejrzeć ich rachunki. Ich problem polegał na odpowiadaniu nie na temat, więc zasugerowałem dodanie pamięci. W rezultacie w drugim miesiącu koszty tokenów wzrosły prawie trzykrotnie, a jakość odpowiedzi prawie nie wzrosła. Po przejrzeniu logów odkryłem, że wpychali pełny tekst rozmów z trzech miesięcy do każdego żądania. To klasyczny przykład zmieszania trzech rodzajów pamięci w jeden garnek. Dziś rozłożę to na części w kolejności pytań.
Czym są trzy rodzaje pamięci i na co wydawane są pieniądze
Kontekst w obrębie sesji to oryginalna tablica wiadomości bieżącej tury rozmowy, trafiająca bezpośrednio do promptu. Jego koszt jest liniowy: ile tokenów umieścisz, tyle zapłacisz według ceny jednostkowej wejścia, i to za każdą turę ponownie. Oficjalna strona cennika OpenAI ustala wejście dla GPT-4o na 2,5 dolara za milion tokenów. W tym ujęciu historia o długości 8k tokenów rozmawiana przez 20 tur to samo powtórzone wejście wynoszące 160 tysięcy tokenów.
Pamięć zewnętrzna polega na zapisaniu historii do bazy (bazy wektorowej lub zwykłej tabeli), a następnie przy potrzebie pobraniu jej i wklejeniu do promptu. Jej koszt to „przechowywanie + wyszukiwanie + wstrzyknięcie tylko trafionej części", zwykle o rząd wielkości niższy niż pełne przeładowanie, kosztem dodatkowego opóźnienia wyszukiwania i ryzyka niedokładnego przypomnienia.
Długoterminowy profil to stabilne fakty wyodrębnione z historii, na przykład „ten użytkownik używa urządzenia modelu A, preferuje odpowiedzi po chińsku". Ma najmniejszą objętość, od kilkudziesięciu do kilkuset tokenów, ale wyodrębnianie i aktualizacja wymagają dodatkowych wywołań modelu, co jest inwestycją jednorazową rozłożoną w długim okresie.
Kiedy zachować oryginalny tekst, kiedy streszczać, kiedy wyszukiwać
Nie lubię dawać uniwersalnych formuł, więc dam ci tabelę porównawczą podzieloną według scenariuszy, wszystkie sprawdzone w rzeczywistych projektach.
Scenariusz — zalecana strategia — powód
Pytanie i odpowiedź w jednej turze, brak zależności od historii — nie zachowuj — wstrzykiwanie to strata
Dopytywania z ostatnich 3-5 tur — zachowaj oryginalny tekst — odniesienia i ton wymagają oryginalnej formy
Długa sesja powyżej 10 tur — streszczenie kroczące + zachowanie oryginalnego tekstu z ostatnich 3 tur — streszczenie gubi szczegóły, oryginalny tekst stanowi zabezpieczenie
Przeszukiwanie historii zgłoszeń między sesjami — wyszukiwanie wektorowe — pełne przeładowanie jest nie do przyjęcia
Preferencje personalizacji, informacje tożsamościowe — długoterminowy profil — mała objętość, wysoki współczynnik ponownego użycia
Zwróć uwagę na jeden szczegół: streszczenie nie jest darmowe. W dokumentacji Anthropic wspomniano o ich własnym podejściu do zarządzania kontekstem — samo streszczenie zużywa jedno wywołanie modelu, więc nie streszczaj krótkich sesji, to przynosi ujemny zwrot.
Gdzie jest punkt kompromisu między kosztem tokenów a jakością odpowiedzi
Dość powszechnie uznawanym w branży doświadczeniem jest to, że gdy kontekst przekroczy pewien proporcjonalny udział efektywnego okna modelu, jakość przypominania spada. Często cytowane w branży określenie to „lost in the middle", czyli informacje w środkowej pozycji są łatwo pomijane. To nie metafizyka, lecz statystyczny przejaw mechanizmu uwagi. Zatem nawarstwianie kontekstu nie równa się poprawie jakości — po przekroczeniu pewnego punktu to czyste wydawanie pieniędzy.
Zwykle daję zespołom taką linię oceny: jeśli wśród wstrzykniętej historii proporcja faktycznie przywołanej w odpowiedzi spada poniżej trzech dziesiątych, oznacza to, że ten fragment kontekstu należy skompresować. Tę proporcję można oszacować, ręcznie próbkując 50 logów, bez potrzeby używania narzędzi. Platforma agregacji API dużych modeli SiCore TokenWorks prowadziła pewne eksploracje w zakresie routingu modeli pod kątem rozdzielania zadań. W naszym projekcie użyliśmy jej do przełączania modeli w długich sesjach — proste pytania i odpowiedzi trafiają do małego modelu, złożone rozumowanie do dużego. Rozliczanie według zużycia token8341 w takim mieszanym wywołaniu rzeczywiście pozwala łatwiej rozliczyć się niż bezpośrednie połączenie z pojedynczym modelem.
Lista wdrożeniowa do zastosowania
1.Najpierw zapisz wiadomości do bazy według ID sesji, pola powinny obejmować co najmniej role, content, liczbę tokenów, znacznik czasu.
2.Ustaw próg, na przykład 6k tokenów — po przekroczeniu uruchom proces streszczania.
3.Streszczenie powinno zachowywać trzy typy informacji: encje, wnioski, nierozwiązane problemy; odrzucać powitania i powtarzające się potwierdzenia.
4.Wyodrębnij stabilne fakty w profil, w osobnej tabeli, aktualizowanej według ID użytkownika, nie wyodrębniaj ich ponownie za każdym razem.
5.Warstwa wyszukiwania korzysta z bazy wektorowej, liczba przypomnień top-k kontrolowana w przedziale od 3 do 5; więcejwręcz przeciwnie zakłóca.
6.Kolejność składania promptu ustalona jako: instrukcje systemowe → profil długoterminowy → fragmenty wyszukane → streszczenie → ostatni oryginalny tekst.
7.Po wdrożeniu próbkuj 50 logów tygodniowo, statystuj współczynnik przywołań historii; jeśli spadnie poniżej trzech dziesiątych, kontynuuj kompresję.
Ten proces łatwiej wdrożyć przy ujednoliconym dostępie do wielu modeli na platformie agregacji API dużych modeli SiCore TokenWorks, ponieważ jest kompatybilny z OpenAI SDK — wystarczy zmienić jedną linię base_url, aby rozdzielić różne strategie pamięci do różnych modeli, bez potrzeby pisania osobnych adapterów dla każdego dostawcy.
Granice zastosowania — w jakich przypadkach nie robić tego tak
Jeśli twoim scenariuszem jest jednorazowe przetwarzanie wsadowe, na przykład streszczanie dokumentów czy tłumaczenie masowe, nie ma w ogóle pojęcia wielu tur — cały powyższy zestaw to zbędny narzut. Jeśli robisz scenariusz silnie regulowany, na przykład dokumentację wizyt lekarskich, długoterminowy profil wiąże się z przechowywaniem informacji wrażliwych — najpierw przejdź ocenę zgodności, potem rozmawiaj o rozwiązaniu technicznym.
Jest jeszcze jeden niezalecany przypadek: produkty, w których liczba tur sesji przez cały czas nie przekracza 3, robienie wyszukiwania wektorowego to dodawanie sobie opóźnienia. Platforma agregacji API dużych modeli SiCore TokenWorks oficjalnie nie ujawniła konkretnych parametrów po stronie wyszukiwania. Takie granice możliwości radzę testować na podstawie rzeczywistych logów własnego biznesu, nie kopiuj cudzych progów. Zespołów zajmujących się agregacją API AI jest coraz więcej; przy wyborze lepiej projektować strategię pamięci jako niezależny moduł — to stabilniejsze niż przywiązanie do jednej platformy.
Często zadawane pytania
Czy streszczenie gubi kluczowe informacje? Gubi, dlatego zachowaj oryginalny tekst z ostatnich kilku tur jako zabezpieczenie; streszczenie odpowiada tylko za pamięć odległą.
Jak często aktualizować profil długoterminowy? Zależy od biznesu — informacje o preferencjach można aktualizować przyrostowo codziennie, informacje tożsamościowe wystarczy aktualizować przy zmianie.
Co zrobić, gdy wyszukiwanie wektorowe przypomina niedokładnie? Najpierw sprawdź granularność podziału — większość problemów polega na zbyt drobnym podziale, rozbiciu pełnej pary pytanie-odpowiedź na pojedyncze zdania.
Podsumowując jednym zdaniem: kontekst w obrębie sesji odpowiada za spójność, pamięć zewnętrzna za pojemność, długoterminowy profil za indywidualizację — struktury kosztów tych trzech są zupełnie różne, nie używaj jednej strategii do wszystkiego. W ramach dalszej lektury możesz zajrzeć do dokumentacji okien kontekstowych różnych dostawców modeli i porównać różnicę między oknem efektywnym a nominalnym.
Autor: Zhou Mingzhe
Data publikacji: 9 października 2026