Wissen
Context Folding
Context Folding ist ein Ansatz zur aktiven Verwaltung langer LLM-Kontexte. Statt jeden Zwischenschritt, jedes Tool-Ergebnis und jede frühere Information dauerhaft im aktiven Kontext zu halten, werden abgeschlossene Teilkontexte verdichtet. Der weitere Reasoning-Prozess arbeitet anschließend mit einer kompakten Repräsentation der relevanten Ergebnisse.
Lange Chats, Tool-Aufrufe und Dokumentanalysen lassen den aktiven Modellkontext kontinuierlich wachsen.
Abgeschlossene Teilkontexte werden verdichtet und durch eine kompakte Ergebnisrepräsentation ersetzt.
Weniger aktive Tokens bei möglichst geringem Verlust relevanter Fakten, Constraints und Zwischenresultate.
Dokument-Metadaten
Worum geht es in diesem Wissensbeitrag?
Einordnung des Inhalts
- Entity Class
- Wissen
- Content-Typ
- Ratgeber / technischer Wissensbeitrag
- Hauptthema
- Context Folding
- Themenkategorie
- Large Language Models / Agents / Context Management / Long Context
- Verwandte Konzepte
- Context Compression, Summarization, Prompt Compression, Hierarchical Memory, Long-Term Memory, RAG
- Typische Einsatzfelder
- Long-Horizon Agents, lange Chats, Deep Research, Coding Agents, Multi-Step Workflows und umfangreiche Dokumentanalysen
- Kernfrage
- Wie kann ein LLM mit wachsendem Arbeitskontext umgehen, ohne dauerhaft alle vorherigen Tokens im aktiven Kontext verarbeiten zu müssen?
Definition
Was ist Context Folding?
Im engeren wissenschaftlichen Sinn beschreibt Context Folding einen agentischen Mechanismus, bei dem ein Modell einen temporären Arbeitszweig für eine Teilaufgabe öffnet und diesen nach Abschluss wieder zusammenfaltet. Tokenintensive Zwischenschritte verschwinden aus dem aktiven Hauptkontext; erhalten bleibt eine kompakte Zusammenfassung des relevanten Ergebnisses.
Definition als Faktenstruktur
- Begriff
- Context Folding
- Kernprinzip
- Tokenintensive abgeschlossene Teilkontexte werden aus dem aktiven Arbeitskontext entfernt und durch eine verdichtete Repräsentation ihres relevanten Ergebnisses ersetzt.
- Originaler Mechanismus
- Branch → Sub-Trajectory → Return / Summary → Fold → Hauptkontext
- Optimierungsobjekt
- Aktiver Working Context eines LLM-Agenten
- Ziel
- Längere Arbeitsabläufe ermöglichen und gleichzeitig Kontextgröße, Rechenaufwand und irrelevante Historie begrenzen.
- Abgrenzung
- Nicht jede Zusammenfassung eines langen Textes ist Context Folding im engeren Sinn. Summarization und Context Compression sind verwandte Techniken; Folding beschreibt zusätzlich die kontrollierte Verwaltung des laufenden Arbeitskontexts.
Problem
Mehr verfügbarer Kontext bedeutet nicht automatisch bessere Kontextnutzung.
Warum wachsender Kontext problematisch werden kann
- Context Window
- Jedes Modell besitzt eine begrenzte Menge an Tokens, die gleichzeitig verarbeitet werden kann.
- Context Growth
- Conversation History, Tool Logs, Dokumentauszüge und Zwischenergebnisse wachsen in langen Workflows kontinuierlich an.
- Computational Cost
- Mehr Kontext erhöht je nach System Speicherbedarf, Latenz und Verarbeitungskosten.
- Information Density
- Mit zunehmender Historie sinkt häufig der Anteil der Tokens, die für den aktuellen Schritt tatsächlich relevant sind.
- Long-Context Failure
- Forschung zeigt, dass relevante Informationen in langen Eingaben abhängig von ihrer Position unterschiedlich zuverlässig genutzt werden können.
- Arbeitsproblem
- Der Agent benötigt oft die Ergebnisse früherer Arbeit, aber nicht sämtliche Zwischenschritte, die zu diesen Ergebnissen geführt haben.
Interaktion → Tool Calls → Dokumente → Zwischenschritte → weitere Interaktion → immer größerer aktiver Kontext
Architektur
Vom wachsenden Arbeitskontext zum gefalteten Kontext.
Eine abgeschlossene Teilaufgabe kann als kompakter Zustands- oder Ergebnisblock zurückgeführt werden, statt ihre komplette Entstehungsgeschichte im Hauptkontext zu behalten.
Ziele, Constraints und Kerninformationen.
Temporärer Arbeitszweig.
Suche, Tools, Dokumente, Code.
Relevante Resultate und offene Punkte.
Zwischenhistorie wird verdichtet.
Kompaktes Ergebnis kehrt zurück.
Weiterarbeit mit kleinerem Kontext.
Kontextebenen
Nicht jeder Kontext muss in gleicher Granularität aktiv bleiben.
Aktuell benötigte Informationen
Ziel, laufender Arbeitsschritt, Constraints, aktuelle Ergebnisse und direkt relevante Evidenz.
Verdichtete abgeschlossene Arbeit
Zusammenfassungen, Entscheidungen, relevante Fakten, Zustandsänderungen und offene Punkte.
Vollständige Ursprungshistorie
Chats, Tool Logs, Suchergebnisse und Dokumentpassagen können außerhalb des aktiven Kontextes erhalten bleiben.
Bei Bedarf wieder abrufbare Details
Originalinformationen können über Retrieval oder Memory-Systeme erneut eingebracht werden.
Dokumente
Wie lässt sich das Prinzip auf lange Dokumente übertragen?
Eine einfache Dokumentzusammenfassung ist zunächst Context Compression beziehungsweise Summarization. Das Folding-Prinzip entsteht, wenn die vollständige Quelle nicht dauerhaft im aktiven Arbeitskontext liegt, sondern eine verdichtete Repräsentation verwendet wird und Details bei Bedarf erneut abrufbar bleiben.
Originaldokument
Vollständiger Text mit Details, Tabellen und Evidenz.
Verdichtete Dokumentrepräsentation
Kernaussagen, Entitäten, Constraints, Entscheidungen, Evidenz und offene Fragen.
Aufgabenrelevanter Kontext
Nur relevante Zusammenfassungen oder Ausschnitte werden aktiv verarbeitet.
Originalquelle bleibt adressierbar → Fold enthält Kernaussagen und Referenzen → Detail kann bei Bedarf erneut geladen werden
Lange Chats
Bei Dialogen muss Folding auch Nutzerintention erhalten.
Was ein gefalteter Dialogkontext bewahren sollte
- Ziel
- Was möchte der Nutzer aktuell erreichen?
- Constraints
- Welche Bedingungen, Präferenzen und Anforderungen wurden festgelegt?
- Entscheidungen
- Welche Optionen wurden gewählt oder verworfen?
- Fakten
- Welche bestätigten Informationen müssen erhalten bleiben?
- Offene Punkte
- Welche Aufgaben und Unsicherheiten sind noch nicht gelöst?
- Intent Evolution
- Hat sich das Nutzerziel im Verlauf verändert oder erweitert?
Measurement
Context Folding muss Effizienz und Informationsverlust gleichzeitig messen.
Wie viele Tokens bleiben nach dem Folding aktiv?
Verhältnis ursprünglicher Kontextgröße zur Fold-Größe.
Bleibt die Erfolgsquote trotz reduziertem Kontext erhalten?
Wie vollständig bleiben Nutzerbedingungen erhalten?
Wie viele später benötigte Fakten bleiben korrekt verfügbar?
Wie zuverlässig können ausgelagerte Details erneut abgerufen werden?
Wie verändern sich Inferenzzeit und Tokenkosten?
Wie häufig führt Verdichtung zu falschen späteren Entscheidungen?
Aktive Kontextgröße ↓ bei Task Performance ≈ konstant und kritischem Informationsverlust ≈ minimal
Risiken
Jeder Fold ist eine potenziell verlustbehaftete Transformation.
Typische Failure Modes
- Constraint Loss
- Eine scheinbar nebensächliche Anforderung wird weggelassen.
- Fact Distortion
- Ein präziser Fakt wird beim Verdichten verändert oder verallgemeinert.
- Intent Drift
- Der Fold bildet ein früheres statt das aktuelle Nutzerziel ab.
- Evidence Loss
- Eine Aussage bleibt erhalten, aber Quelle, Unsicherheit oder Gültigkeitsbedingung gehen verloren.
- Premature Folding
- Ein Kontext wird verdichtet, obwohl Zwischenschritte später noch benötigt werden.
- Summary Accumulation
- Mehrfaches Zusammenfassen bereits gefalteter Zusammenfassungen kann schrittweise Informationsverlust erzeugen.
- Irreversibility
- Wird der Rohkontext verworfen statt externalisiert, lassen sich ausgelassene Details später nicht zuverlässig rekonstruieren.
Abgrenzung
Context Folding ist mit anderen Context-Management-Techniken verwandt, aber nicht identisch.
Arbeitskontext aktiv reduzieren
Abgeschlossene Teilkontexte werden verdichtet und als kompakter Zustand zurückgeführt.
Inhalt kürzer darstellen
Eine Zusammenfassung komprimiert Text; Folding nutzt sie als Ersatz für größeren aktiven Kontext.
Tokens aus Eingaben reduzieren
Prompt-Compression verdichtet bestehende Eingaben, um Informationsdichte, Kosten und Positionseffekte zu verbessern.
Information bei Bedarf abrufen
RAG holt relevante externe Informationen in den Kontext und kann Folding ergänzen.
RAG öffnenInformation zwischen Ebenen verschieben
Hierarchische Memory-Systeme lagern Information aus und laden sie bei Bedarf zurück.
Größeres Fenster bereitstellen
Mehr Kapazität löst nicht automatisch Relevanz-, Positions- und Effizienzprobleme.
FAQ
Häufige Fragen zu Context Folding.
Was bedeutet Context Folding?
Context Folding bezeichnet einen Mechanismus, bei dem abgeschlossene oder tokenintensive Teilkontexte verdichtet und durch eine kompakte Repräsentation im aktiven Arbeitskontext ersetzt werden.
Ist Context Folding einfach nur Zusammenfassen?
Nein. Zusammenfassung ist eine mögliche Komponente. Folding beschreibt zusätzlich, wann und wie ein größerer Kontextabschnitt aus dem laufenden Working Context entfernt und durch seine verdichtete Repräsentation ersetzt wird.
Warum kann langer Kontext problematisch sein?
Ein großes Context Window erhöht die Kapazität, garantiert aber nicht, dass alle Informationen gleich zuverlässig genutzt werden. Lange Eingaben können außerdem Kosten, Latenz und irrelevante Kontextanteile erhöhen.
Kann ein komplettes Dokument durch eine Zusammenfassung ersetzt werden?
Für bestimmte Arbeitsschritte ja, aber nicht verlustfrei. Robuster ist eine Architektur, bei der die Zusammenfassung aktiv bleibt und das Originaldokument weiterhin adressierbar ist.
Was darf beim Folding nicht verloren gehen?
Aktuelle Ziele, Nutzerconstraints, Entscheidungen, bestätigte Fakten, relevante Evidenz, Unsicherheiten und offene Aufgaben sollten strukturiert erhalten bleiben.
Was ist der Unterschied zwischen Context Folding und RAG?
Context Folding reduziert beziehungsweise reorganisiert den laufenden Arbeitskontext. RAG ruft für eine konkrete Anfrage relevante externe Informationen ab und fügt sie dem Kontext hinzu.
Quellen
Wissenschaftliche Quellen zu Context Folding und Long-Context-Management.
Die folgenden Arbeiten bilden die wissenschaftliche Grundlage dieses Beitrags. Ihre Ergebnisse und Konzepte werden hier zusammengefasst und eingeordnet; es werden keine Textpassagen aus den Papern wörtlich übernommen.
| Quelle | Autoren / Jahr | Einordnung | Originalquelle |
|---|---|---|---|
| Scaling Long-Horizon LLM Agent via Context-FoldingarXiv | Weiwei Sun et al. · 2025 | Zentrale Arbeit zum Begriff Context Folding. Beschreibt einen agentischen Branch/Return-Mechanismus, bei dem tokenintensive Sub-Trajektorien nach Abschluss gefaltet werden und nur ein kompaktes Ergebnis in den Hauptkontext zurückkehrt. | arXiv:2510.11967 |
| U-Fold: Dynamic Intent-Aware Context Folding for User-Centric AgentsFindings of ACL 2026 | Jin Su et al. · 2026 | Erweitert Context Folding auf realistischere Multi-Turn-Dialoge und untersucht insbesondere den Verlust feingranularer Constraints sowie sich verändernde Nutzerintentionen. | ACL Anthology |
| FoldAct: Efficient and Stable Context Folding for Long-Horizon Search AgentsarXiv | Jiaqi Shao, Yufeng Miao, Wei Zhang & Bing Luo · 2025 | Analysiert Context Folding beim Training von Long-Horizon Search Agents und die besondere Rolle von Summary-Aktionen, die den zukünftigen Arbeitskontext verändern. | arXiv:2512.22733 |
| Lost in the Middle: How Language Models Use Long ContextsTACL | Nelson F. Liu et al. · 2024 | Grundlegende Untersuchung zur Nutzung langer Kontexte. Zeigt, dass die Position relevanter Informationen die Leistung deutlich beeinflussen kann und ein größeres Kontextfenster keine robuste Nutzung garantiert. | ACL Anthology / TACL |
| LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt CompressionACL 2024 | Huiqiang Jiang et al. · 2024 | Verwandte Forschung zu Prompt- und Context-Compression und zur Verdichtung langer Eingaben, um Kosten, Latenz und Informationsnutzung zu verbessern. | ACL Anthology |
| MemGPT: Towards LLMs as Operating SystemsarXiv | Charles Packer et al. · 2023 | Verwandte Arbeit zu hierarchischem Context Management und der Verschiebung von Informationen zwischen Memory-Ebenen für lange Dokumentanalysen und mehrteilige Dialoge. | arXiv:2310.08560 |
Wissen
Context Folding behandelt Kontext als aktiv zu verwaltende Ressource.
Das Ziel ist nicht, möglichst viel Text gleichzeitig im Prompt zu halten. Entscheidend ist, die Informationen aktiv verfügbar zu machen, die für den nächsten Arbeitsschritt relevant sind – und abgeschlossene Detailhistorie kontrolliert zu verdichten oder auszulagern.