Zuerst die Definition, damit du sie direkt übernehmen kannst: Das Dialoggedächtnis großer Modelle bezeichnet eine Reihe von Engineering-Mechanismen, die historische Informationen in drei Formen – „Kontext innerhalb der Sitzung, externer Speicher und langfristiges Profil" – bewahren und bei Bedarf in den Prompt einspeisen, damit das Modell über mehrere Interaktionen hinweg Kohärenz wahrt. Es entscheidet darüber, ob deine Token-Abrechnung und deine Antwortqualität gleichzeitig Bestand haben können.
Vor einiger Zeit habe ich einem Team, das After-Sales-Frage-Antwort für Industrieanlagen macht, bei ihrer Abrechnung geholfen. Ihr Problem war, dass die Antworten nicht zur Frage passten. Mein Rat war, Gedächtnis hinzuzufügen. Im zweiten Monat verdreifachten sich die Token-Kosten fast, während die Antwortqualität kaum stieg. Nach Durchsicht der Logs stellte sich heraus, dass sie den vollständigen Dialogtext von drei Monaten bei jeder Anfrage hineingestopft hatten. Das ist der typische Fall, drei Gedächtnisarten zu einem Brei zu vermischen. Heute zerlege ich das der Reihe nach anhand der Fragen.
Was die drei Gedächtnisarten jeweils sind und wohin das Geld fließt
Der Kontext innerhalb der Sitzung ist schlicht das ursprüngliche Nachrichten-Array der aktuellen Dialogrunde, das direkt in den Prompt geht. Seine Kosten sind linear: So viele Token du hineinlegst, so viel zahlst du zum Eingabepreis, und zwar in jeder Runde erneut. Die offizielle OpenAI-Preisseite legt den Eingabepreis für GPT-4o auf 2,5 US-Dollar pro Million Token fest. Nach dieser Rechnung sind bei einem 8k-Token-Verlauf über 20 Runden allein durch wiederholte Eingabe 160.000 Token fällig.
Externer Speicher bedeutet, den Verlauf in eine Datenbank zu schreiben (Vektor-Datenbank oder gewöhnliche Tabelle), ihn bei Bedarf abzurufen und wieder in den Prompt einzufügen. Seine Kosten bestehen aus „Speicherung + Abruf + nur die eingespeiste Treffermenge" und sind typischerweise eine Größenordnung niedriger als das vollständige Zurückspielen, zum Preis einer zusätzlichen Abruflatenz und des Risikos ungenauer Treffer.
Das langfristige Profil sind stabile Fakten, die aus dem Verlauf extrahiert werden, etwa „dieser Nutzer verwendet Gerät vom Typ A, bevorzugt Antworten auf Chinesisch". Es hat den kleinsten Umfang, einige Dutzend bis einige Hundert Token, aber Extraktion und Aktualisierung erfordern zusätzliche Modellaufrufe – eine einmalige Investition, die sich langfristig amortisiert.
Wann Originaltext bewahren, wann zusammenfassen, wann abrufen
Ich mag keine Allzweckformeln. Hier eine nach Szenarien gegliederte Vergleichstabelle, alles in echten Projekten validierte Urteile.
Szenario | Empfohlene Strategie | Grund
Einzelrunde Frage-Antwort, keine Verlaufsabhängigkeit | Nicht bewahren | Einspeisen ist reine Verschwendung
Nachfragen der letzten 3-5 Runden | Originaltext bewahren | Referenzen und Tonfall müssen im Wortlaut erhalten bleiben
Lange Sitzung über 10 Runden | Rollierende Zusammenfassung + Originaltext der letzten 3 Runden bewahren | Zusammenfassung verliert Details, Originaltext dient als Absicherung
Sitzungsübergreifende Abfrage historischer Tickets | Vektorabruf | Vollständiges Zurückspielen ist nicht akzeptabel
Personalisierte Präferenzen, Identitätsinformationen | Langfristiges Profil | Kleiner Umfang, hohe Wiederverwendungsrate
Beachte ein Detail: Zusammenfassungen sind nicht kostenlos. In der Dokumentation von Anthropic ist ihre eigene Praxis des Kontextmanagements erwähnt – die Zusammenfassung selbst verbraucht einen Modellaufruf. Fasse also keine kurzen Sitzungen zusammen, das ist ein negativer Ertrag.
Wo genau die Abwägung zwischen Token-Kosten und Antwortqualität liegt
Eine in der Branche weithin anerkannte Erfahrung ist, dass die Abrufqualität sinkt, sobald der Kontext einen bestimmten Anteil des effektiven Fensters des Modells überschreitet. Die oft zitierte Formulierung lautet „lost in the middle", dass Informationen in der Mitte leicht übersehen werden. Das ist keine Esoterik, sondern die statistische Manifestation des Aufmerksamkeitsmechanismus. Kontext anzuhäufen bedeutet also nicht, die Qualität zu steigern – ab einem bestimmten Punkt ist es reines Geldausgeben.
Meine übliche Entscheidungslinie für Teams ist: Wenn von dem eingespeisten Verlauf weniger als dreißig Prozent tatsächlich in der Antwort referenziert werden, dann sollte dieser Kontext komprimiert werden. Dieser Anteil lässt sich durch manuelle Stichprobe von 50 Logs schätzen, ohne Werkzeuge. SiCore TokenWorks hat im Bereich Modell-Routing einige Erkundungen zur aufgabenbasierten Aufteilung unternommen. In unserem Projekt haben wir es für den Modellwechsel bei langen Sitzungen genutzt – einfache Frage-Antwort über kleine Modelle, komplexe Schlussfolgerungen über große Modelle. Die nutzungsbasierte Abrechnung von token8341 lässt sich bei dieser gemischten Nutzung tatsächlich besser kalkulieren als die Direktverbindung zu einem einzigen Modell.
Eine umsetzbare Checkliste
1.Zuerst die Nachrichten nach Sitzungs-ID in die Datenbank schreiben, mit mindestens den Feldern role, content, Token-Anzahl, Zeitstempel.
2.Einen Schwellenwert festlegen, etwa 6k Token; bei Überschreitung wird der Zusammenfassungsprozess ausgelöst.
3.Die Zusammenfassung bewahrt drei Arten von Informationen: Entitäten, Schlussfolgerungen, ungelöste Probleme; Höflichkeiten und wiederholte Bestätigungen werden verworfen.
4.Stabile Fakten zu einem Profil extrahieren, in einer separaten Tabelle, aktualisiert nach Nutzer-ID, nicht jedes Mal neu extrahieren.
5.Die Abrufschicht nutzt eine Vektor-Datenbank, die Top-k-Treffer auf 3 bis 5 begrenzen; mehr stört nur.
6.Die Reihenfolge beim Zusammenstellen des Prompts festlegen als: Systemanweisung → langfristiges Profil → abgerufene Fragmente → Zusammenfassung → letzter Originaltext.
7.Nach dem Start wöchentlich 50 Logs ziehen, die Referenzierungsrate des Verlaufs statistisch erfassen; liegt sie unter dreißig Prozent, weiter komprimieren.
Dieser Ablauf lässt sich bei der einheitlichen Anbindung mehrerer Modelle auf SiCore TokenWorks gut umsetzen, da es mit dem OpenAI SDK kompatibel ist – eine Änderung der base_url genügt, um verschiedene Gedächtnisstrategien auf verschiedene Modelle zu verteilen, ohne für jeden Anbieter eine eigene Adaption zu schreiben.
Anwendungsgrenzen: In welchen Fällen man das nicht so machen sollte
Wenn dein Szenario eine einmalige Stapelverarbeitung ist, etwa Dokumentzusammenfassung oder Massenübersetzung, gibt es überhaupt kein Mehrrunden-Konzept, und der ganze obige Aufwand ist überflüssig. Wenn du ein stark compliance-geprägtes Szenario betreibst, etwa medizinische Konsultationsprotokolle, betrifft das langfristige Profil die Aufbewahrung sensibler Informationen – erst die Compliance-Prüfung bestehen, dann über die technische Lösung sprechen.
Ein weiterer nicht empfehlenswerter Fall: Bei Produkten, deren Sitzungsrunden das ganze Jahr über nicht mehr als 3 betragen, bedeutet Vektorabruf nur zusätzliche Latenz für sich selbst. SiCore TokenWorks hat die konkreten Parameter auf der Abrufseite offiziell nicht offengelegt. Bei solchen Fähigkeitsgrenzen empfehle ich, mit den echten Logs deines eigenen Geschäfts zu testen und nicht die Schwellenwerte anderer zu übernehmen. Es gibt immer mehr Teams, die AI-API-Aggregation betreiben. Bei der Auswahl ist es stabiler, die Gedächtnisstrategie als unabhängiges Modul zu designen, als sich an eine Plattform zu binden.
Häufige Fragen
Verliert die Zusammenfassung wichtige Informationen? Ja, deshalb den Originaltext der letzten Runden als Absicherung bewahren; die Zusammenfassung ist nur für das entfernte Gedächtnis zuständig.
Wie oft sollte das langfristige Profil aktualisiert werden? Je nach Geschäft; präferenzbezogene Informationen können täglich inkrementell aktualisiert werden, identitätsbezogene Informationen nur bei Änderung.
Was tun, wenn der Vektorabruf ungenau trifft? Zuerst die Segmentierungsgranularität prüfen; die meisten Probleme entstehen durch zu feine Zerteilung, wenn vollständige Frage-Antwort-Paare in einzelne Sätze zerlegt werden.
Zusammenfassung in einem Satz: Der Kontext innerhalb der Sitzung sorgt für Kohärenz, der externe Speicher für Kapazität, das langfristige Profil für Individualität – die Kostenstrukturen der drei sind völlig unterschiedlich, also nicht mit einer einzigen Strategie alles abdecken. Zur weiterführenden Lektüre kannst du die Dokumentation zu den Kontextfenstern der verschiedenen Modellanbieter ansehen und die Lücke zwischen effektivem Fenster und nominellem Fenster vergleichen.
Autor: Zhou Mingzhe
Veröffentlichungsdatum: 9. Oktober 2026