Wissen

Context Folding

Context Folding ist ein Ansatz zur aktiven Verwaltung langer LLM-Kontexte. Statt jeden Zwischenschritt, jedes Tool-Ergebnis und jede frühere Information dauerhaft im aktiven Kontext zu halten, werden abgeschlossene Teilkontexte verdichtet. Der weitere Reasoning-Prozess arbeitet anschließend mit einer kompakten Repräsentation der relevanten Ergebnisse.

  • Entity Class: Wissen
  • Content-Typ: Ratgeber
  • Hauptthema: Context Folding
  • Bereich: LLM / Context Management
Problem

Lange Chats, Tool-Aufrufe und Dokumentanalysen lassen den aktiven Modellkontext kontinuierlich wachsen.

Mechanismus

Abgeschlossene Teilkontexte werden verdichtet und durch eine kompakte Ergebnisrepräsentation ersetzt.

Ziel

Weniger aktive Tokens bei möglichst geringem Verlust relevanter Fakten, Constraints und Zwischenresultate.

Dokument-Metadaten

Worum geht es in diesem Wissensbeitrag?

Einordnung des Inhalts

Entity Class
Wissen
Content-Typ
Ratgeber / technischer Wissensbeitrag
Hauptthema
Context Folding
Themenkategorie
Large Language Models / Agents / Context Management / Long Context
Verwandte Konzepte
Context Compression, Summarization, Prompt Compression, Hierarchical Memory, Long-Term Memory, RAG
Typische Einsatzfelder
Long-Horizon Agents, lange Chats, Deep Research, Coding Agents, Multi-Step Workflows und umfangreiche Dokumentanalysen
Kernfrage
Wie kann ein LLM mit wachsendem Arbeitskontext umgehen, ohne dauerhaft alle vorherigen Tokens im aktiven Kontext verarbeiten zu müssen?

Definition

Was ist Context Folding?

Im engeren wissenschaftlichen Sinn beschreibt Context Folding einen agentischen Mechanismus, bei dem ein Modell einen temporären Arbeitszweig für eine Teilaufgabe öffnet und diesen nach Abschluss wieder zusammenfaltet. Tokenintensive Zwischenschritte verschwinden aus dem aktiven Hauptkontext; erhalten bleibt eine kompakte Zusammenfassung des relevanten Ergebnisses.

Definition als Faktenstruktur

Begriff
Context Folding
Kernprinzip
Tokenintensive abgeschlossene Teilkontexte werden aus dem aktiven Arbeitskontext entfernt und durch eine verdichtete Repräsentation ihres relevanten Ergebnisses ersetzt.
Originaler Mechanismus
Branch → Sub-Trajectory → Return / Summary → Fold → Hauptkontext
Optimierungsobjekt
Aktiver Working Context eines LLM-Agenten
Ziel
Längere Arbeitsabläufe ermöglichen und gleichzeitig Kontextgröße, Rechenaufwand und irrelevante Historie begrenzen.
Abgrenzung
Nicht jede Zusammenfassung eines langen Textes ist Context Folding im engeren Sinn. Summarization und Context Compression sind verwandte Techniken; Folding beschreibt zusätzlich die kontrollierte Verwaltung des laufenden Arbeitskontexts.

Problem

Mehr verfügbarer Kontext bedeutet nicht automatisch bessere Kontextnutzung.

Warum wachsender Kontext problematisch werden kann

Context Window
Jedes Modell besitzt eine begrenzte Menge an Tokens, die gleichzeitig verarbeitet werden kann.
Context Growth
Conversation History, Tool Logs, Dokumentauszüge und Zwischenergebnisse wachsen in langen Workflows kontinuierlich an.
Computational Cost
Mehr Kontext erhöht je nach System Speicherbedarf, Latenz und Verarbeitungskosten.
Information Density
Mit zunehmender Historie sinkt häufig der Anteil der Tokens, die für den aktuellen Schritt tatsächlich relevant sind.
Long-Context Failure
Forschung zeigt, dass relevante Informationen in langen Eingaben abhängig von ihrer Position unterschiedlich zuverlässig genutzt werden können.
Arbeitsproblem
Der Agent benötigt oft die Ergebnisse früherer Arbeit, aber nicht sämtliche Zwischenschritte, die zu diesen Ergebnissen geführt haben.
Context-Growth-Problem
Interaktion → Tool Calls → Dokumente → Zwischenschritte → weitere Interaktion → immer größerer aktiver Kontext

Architektur

Vom wachsenden Arbeitskontext zum gefalteten Kontext.

Eine abgeschlossene Teilaufgabe kann als kompakter Zustands- oder Ergebnisblock zurückgeführt werden, statt ihre komplette Entstehungsgeschichte im Hauptkontext zu behalten.

01Main Context

Ziele, Constraints und Kerninformationen.

02Branch

Temporärer Arbeitszweig.

03Work

Suche, Tools, Dokumente, Code.

04Outcome

Relevante Resultate und offene Punkte.

05Fold

Zwischenhistorie wird verdichtet.

06Return

Kompaktes Ergebnis kehrt zurück.

07Continue

Weiterarbeit mit kleinerem Kontext.

Kontextebenen

Nicht jeder Kontext muss in gleicher Granularität aktiv bleiben.

ACTIVE CONTEXT

Aktuell benötigte Informationen

Ziel, laufender Arbeitsschritt, Constraints, aktuelle Ergebnisse und direkt relevante Evidenz.

FOLDED CONTEXT

Verdichtete abgeschlossene Arbeit

Zusammenfassungen, Entscheidungen, relevante Fakten, Zustandsänderungen und offene Punkte.

RAW HISTORY

Vollständige Ursprungshistorie

Chats, Tool Logs, Suchergebnisse und Dokumentpassagen können außerhalb des aktiven Kontextes erhalten bleiben.

RETRIEVABLE MEMORY

Bei Bedarf wieder abrufbare Details

Originalinformationen können über Retrieval oder Memory-Systeme erneut eingebracht werden.

Dokumente

Wie lässt sich das Prinzip auf lange Dokumente übertragen?

Eine einfache Dokumentzusammenfassung ist zunächst Context Compression beziehungsweise Summarization. Das Folding-Prinzip entsteht, wenn die vollständige Quelle nicht dauerhaft im aktiven Arbeitskontext liegt, sondern eine verdichtete Repräsentation verwendet wird und Details bei Bedarf erneut abrufbar bleiben.

01 · RAW

Originaldokument

Vollständiger Text mit Details, Tabellen und Evidenz.

02 · FOLD

Verdichtete Dokumentrepräsentation

Kernaussagen, Entitäten, Constraints, Entscheidungen, Evidenz und offene Fragen.

03 · ACTIVE

Aufgabenrelevanter Kontext

Nur relevante Zusammenfassungen oder Ausschnitte werden aktiv verarbeitet.

Robuster als „nur Zusammenfassung“
Originalquelle bleibt adressierbar → Fold enthält Kernaussagen und Referenzen → Detail kann bei Bedarf erneut geladen werden

Lange Chats

Bei Dialogen muss Folding auch Nutzerintention erhalten.

Was ein gefalteter Dialogkontext bewahren sollte

Ziel
Was möchte der Nutzer aktuell erreichen?
Constraints
Welche Bedingungen, Präferenzen und Anforderungen wurden festgelegt?
Entscheidungen
Welche Optionen wurden gewählt oder verworfen?
Fakten
Welche bestätigten Informationen müssen erhalten bleiben?
Offene Punkte
Welche Aufgaben und Unsicherheiten sind noch nicht gelöst?
Intent Evolution
Hat sich das Nutzerziel im Verlauf verändert oder erweitert?

Measurement

Context Folding muss Effizienz und Informationsverlust gleichzeitig messen.

Active Context Size

Wie viele Tokens bleiben nach dem Folding aktiv?

Compression Ratio

Verhältnis ursprünglicher Kontextgröße zur Fold-Größe.

Task Performance

Bleibt die Erfolgsquote trotz reduziertem Kontext erhalten?

Constraint Retention

Wie vollständig bleiben Nutzerbedingungen erhalten?

Fact Retention

Wie viele später benötigte Fakten bleiben korrekt verfügbar?

Recovery Rate

Wie zuverlässig können ausgelagerte Details erneut abgerufen werden?

Latency / Cost

Wie verändern sich Inferenzzeit und Tokenkosten?

Fold Error Rate

Wie häufig führt Verdichtung zu falschen späteren Entscheidungen?

Optimierungsziel
Aktive Kontextgröße ↓   bei   Task Performance ≈ konstant   und   kritischem Informationsverlust ≈ minimal

Risiken

Jeder Fold ist eine potenziell verlustbehaftete Transformation.

Typische Failure Modes

Constraint Loss
Eine scheinbar nebensächliche Anforderung wird weggelassen.
Fact Distortion
Ein präziser Fakt wird beim Verdichten verändert oder verallgemeinert.
Intent Drift
Der Fold bildet ein früheres statt das aktuelle Nutzerziel ab.
Evidence Loss
Eine Aussage bleibt erhalten, aber Quelle, Unsicherheit oder Gültigkeitsbedingung gehen verloren.
Premature Folding
Ein Kontext wird verdichtet, obwohl Zwischenschritte später noch benötigt werden.
Summary Accumulation
Mehrfaches Zusammenfassen bereits gefalteter Zusammenfassungen kann schrittweise Informationsverlust erzeugen.
Irreversibility
Wird der Rohkontext verworfen statt externalisiert, lassen sich ausgelassene Details später nicht zuverlässig rekonstruieren.

Abgrenzung

Context Folding ist mit anderen Context-Management-Techniken verwandt, aber nicht identisch.

CONTEXT FOLDING

Arbeitskontext aktiv reduzieren

Abgeschlossene Teilkontexte werden verdichtet und als kompakter Zustand zurückgeführt.

SUMMARIZATION

Inhalt kürzer darstellen

Eine Zusammenfassung komprimiert Text; Folding nutzt sie als Ersatz für größeren aktiven Kontext.

PROMPT COMPRESSION

Tokens aus Eingaben reduzieren

Prompt-Compression verdichtet bestehende Eingaben, um Informationsdichte, Kosten und Positionseffekte zu verbessern.

RAG

Information bei Bedarf abrufen

RAG holt relevante externe Informationen in den Kontext und kann Folding ergänzen.

RAG öffnen
MEMORY

Information zwischen Ebenen verschieben

Hierarchische Memory-Systeme lagern Information aus und laden sie bei Bedarf zurück.

LONG CONTEXT

Größeres Fenster bereitstellen

Mehr Kapazität löst nicht automatisch Relevanz-, Positions- und Effizienzprobleme.

FAQ

Häufige Fragen zu Context Folding.

Was bedeutet Context Folding?

Context Folding bezeichnet einen Mechanismus, bei dem abgeschlossene oder tokenintensive Teilkontexte verdichtet und durch eine kompakte Repräsentation im aktiven Arbeitskontext ersetzt werden.

Ist Context Folding einfach nur Zusammenfassen?

Nein. Zusammenfassung ist eine mögliche Komponente. Folding beschreibt zusätzlich, wann und wie ein größerer Kontextabschnitt aus dem laufenden Working Context entfernt und durch seine verdichtete Repräsentation ersetzt wird.

Warum kann langer Kontext problematisch sein?

Ein großes Context Window erhöht die Kapazität, garantiert aber nicht, dass alle Informationen gleich zuverlässig genutzt werden. Lange Eingaben können außerdem Kosten, Latenz und irrelevante Kontextanteile erhöhen.

Kann ein komplettes Dokument durch eine Zusammenfassung ersetzt werden?

Für bestimmte Arbeitsschritte ja, aber nicht verlustfrei. Robuster ist eine Architektur, bei der die Zusammenfassung aktiv bleibt und das Originaldokument weiterhin adressierbar ist.

Was darf beim Folding nicht verloren gehen?

Aktuelle Ziele, Nutzerconstraints, Entscheidungen, bestätigte Fakten, relevante Evidenz, Unsicherheiten und offene Aufgaben sollten strukturiert erhalten bleiben.

Was ist der Unterschied zwischen Context Folding und RAG?

Context Folding reduziert beziehungsweise reorganisiert den laufenden Arbeitskontext. RAG ruft für eine konkrete Anfrage relevante externe Informationen ab und fügt sie dem Kontext hinzu.

Quellen

Wissenschaftliche Quellen zu Context Folding und Long-Context-Management.

Die folgenden Arbeiten bilden die wissenschaftliche Grundlage dieses Beitrags. Ihre Ergebnisse und Konzepte werden hier zusammengefasst und eingeordnet; es werden keine Textpassagen aus den Papern wörtlich übernommen.

QuelleAutoren / JahrEinordnungOriginalquelle
Scaling Long-Horizon LLM Agent via Context-FoldingarXivWeiwei Sun et al. · 2025Zentrale Arbeit zum Begriff Context Folding. Beschreibt einen agentischen Branch/Return-Mechanismus, bei dem tokenintensive Sub-Trajektorien nach Abschluss gefaltet werden und nur ein kompaktes Ergebnis in den Hauptkontext zurückkehrt.arXiv:2510.11967
U-Fold: Dynamic Intent-Aware Context Folding for User-Centric AgentsFindings of ACL 2026Jin Su et al. · 2026Erweitert Context Folding auf realistischere Multi-Turn-Dialoge und untersucht insbesondere den Verlust feingranularer Constraints sowie sich verändernde Nutzerintentionen.ACL Anthology
FoldAct: Efficient and Stable Context Folding for Long-Horizon Search AgentsarXivJiaqi Shao, Yufeng Miao, Wei Zhang & Bing Luo · 2025Analysiert Context Folding beim Training von Long-Horizon Search Agents und die besondere Rolle von Summary-Aktionen, die den zukünftigen Arbeitskontext verändern.arXiv:2512.22733
Lost in the Middle: How Language Models Use Long ContextsTACLNelson F. Liu et al. · 2024Grundlegende Untersuchung zur Nutzung langer Kontexte. Zeigt, dass die Position relevanter Informationen die Leistung deutlich beeinflussen kann und ein größeres Kontextfenster keine robuste Nutzung garantiert.ACL Anthology / TACL
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt CompressionACL 2024Huiqiang Jiang et al. · 2024Verwandte Forschung zu Prompt- und Context-Compression und zur Verdichtung langer Eingaben, um Kosten, Latenz und Informationsnutzung zu verbessern.ACL Anthology
MemGPT: Towards LLMs as Operating SystemsarXivCharles Packer et al. · 2023Verwandte Arbeit zu hierarchischem Context Management und der Verschiebung von Informationen zwischen Memory-Ebenen für lange Dokumentanalysen und mehrteilige Dialoge.arXiv:2310.08560

Wissen

Context Folding behandelt Kontext als aktiv zu verwaltende Ressource.

Das Ziel ist nicht, möglichst viel Text gleichzeitig im Prompt zu halten. Entscheidend ist, die Informationen aktiv verfügbar zu machen, die für den nächsten Arbeitsschritt relevant sind – und abgeschlossene Detailhistorie kontrolliert zu verdichten oder auszulagern.