Wissen
GraphRAG
GraphRAG erweitert Retrieval-Augmented Generation um graphstrukturierte Information. Statt Wissen ausschließlich als unabhängige Textpassagen zu behandeln, werden Entitäten, Beziehungen, Communities, Pfade und andere Strukturen explizit modelliert. Dadurch kann Retrieval nicht nur semantisch ähnliche Textstellen finden, sondern auch zusammenhängende Informationen über mehrere Quellen und Beziehungen hinweg erschließen.
Query → ähnliche Textchunks → Kontext → generierte Antwort.
Query → Entitäten / Relationen / Communities → zusammenhängende Evidenz → Antwort.
Multi-Hop-Fragen, relationale Abhängigkeiten und globale Fragen über größere Wissensbestände.
Dokument-Metadaten
Worum geht es in diesem Wissensbeitrag?
Einordnung des Inhalts
- Entity Class
- Wissen
- Content-Typ
- Ratgeber / technischer Wissensbeitrag
- Hauptthema
- GraphRAG
- Vollständige Bezeichnung
- Graph Retrieval-Augmented Generation
- Themenkategorie
- Retrieval-Augmented Generation / Knowledge Graphs / Graph Retrieval / LLM
- Primäres Wissensobjekt
- Graph aus Entitäten, Beziehungen, Quellen und gegebenenfalls Communities
- Kernfrage
- Wie kann ein LLM nicht nur einzelne relevante Textstellen, sondern auch die Beziehungen zwischen Informationen für Retrieval und Antwortgenerierung nutzen?
Definition
Was ist GraphRAG?
GraphRAG bezeichnet eine Familie von RAG-Architekturen, die Graphstrukturen für Wissensrepräsentation, Retrieval oder Kontextorganisation verwenden. Knoten können beispielsweise Personen, Unternehmen, Produkte, Orte, Themen oder Dokumente repräsentieren. Kanten modellieren Beziehungen zwischen diesen Objekten.
Definition als Faktenstruktur
- Input
- Dokumente, strukturierte Daten oder bereits vorhandene Knowledge Graphs
- Graphrepräsentation
- Knoten / Entitäten + Kanten / Beziehungen + optionale Attribute und Quellen
- Retrieval
- Auswahl relevanter Knoten, Relationen, Pfade, Subgraphen, Communities oder zugehöriger Textpassagen
- Kontext
- Graphwissen wird in eine für das LLM nutzbare textuelle oder strukturierte Kontextrepräsentation überführt
- Generation
- Das LLM erzeugt eine Antwort auf Basis der ausgewählten graphbasierten Evidenz
- Hauptnutzen
- Explizite Nutzung von Zusammenhängen, die über einzelne isolierte Textchunks hinausgehen
Terminologie
GraphRAG ist Methodenfamilie und konkrete Architekturbezeichnung
Allgemeine Methodenfamilie
GraphRAG wird als Oberbegriff für RAG-Systeme verwendet, die Graphen als Datenquelle, Retrievalstruktur oder Kontextorganisationsschicht einsetzen.
Konkrete Corpus-to-Graph-Architektur
Microsoft Research beschreibt eine spezifische Pipeline, die aus Dokumenten einen Entity Graph erzeugt, Communities identifiziert und Community Reports für Local und Global Search nutzt.
Kernmodell
Von unstrukturiertem Wissen zum abfragbaren Informationsgraphen
Dokumente, Tabellen, Datenbanken oder andere Wissensquellen.
Personen, Produkte, Organisationen, Themen oder andere Objekte erkennen.
Beziehungen zwischen Entitäten extrahieren oder übernehmen.
Knoten, Kanten, Attribute und Quellen verbinden.
Nutzerfrage auf relevante Entitäten, Themen und Relationen abbilden.
Pfade, Nachbarschaften, Communities oder Subgraphen bestimmen.
Graphinformation und Originalquellen für das LLM zusammenstellen.
Antwort erzeugen und auf Evidenz zurückführen.
Problem
Flat Retrieval sieht häufig einzelne Fundstellen, aber nicht deren Gesamtstruktur
Typische Grenzen klassischen Chunk-Retrievals
- Fragmentierung
- Zusammengehörige Informationen können über viele Dokumente und Textchunks verteilt sein
- Relationen
- Semantische Ähnlichkeit modelliert nicht explizit, wie zwei Entitäten miteinander verbunden sind
- Multi-Hop
- Eine Frage kann mehrere aufeinanderfolgende Beziehungen erfordern, bevor die relevante Evidenz gefunden wird
- Global Questions
- Fragen nach Themen, Mustern oder Entwicklungen besitzen häufig keinen einzelnen optimal ähnlichen Chunk
- Entity Ambiguity
- Gleichnamige oder ähnliche Entitäten können ohne explizite Identitätsstruktur vermischt werden
- Context Assembly
- Top-k ähnliche Chunks müssen nicht gemeinsam eine kohärente Informationsbasis bilden
Graphbestandteile
Welche Elemente kann ein GraphRAG-Wissensmodell enthalten?
Entität
Eindeutiges Wissensobjekt wie Unternehmen, Produkt, Person, Standort, Ereignis, Thema oder Dokument.
Relation
Explizite Beziehung zwischen zwei Objekten, beispielsweise „gehört zu“, „kompatibel mit“, „liefert an“ oder „wird erwähnt in“.
Eigenschaft
Strukturierte Werte und Metadaten eines Knotens oder einer Relation.
Provenance
Referenz auf Dokument, Passage, Datensatz oder Ursprung, aus dem eine Entität oder Beziehung stammt.
Zusammenhängende Gruppe
Cluster stark verbundener Entitäten, die einen Themen- oder Beziehungskomplex bilden können.
Mehrstufiger Zusammenhang
Folge mehrerer Knoten und Relationen, über die komplexe Multi-Hop-Beziehungen abgebildet werden.
Indexing
GraphRAG benötigt vor dem Retrieval eine Graphstruktur
Der Graph kann bereits als strukturierte Datenquelle vorhanden sein oder erst aus unstrukturierten Dokumenten erzeugt werden.
Quelltexte werden in verarbeitbare Segmente zerlegt.
Entitäten, Beziehungen und gegebenenfalls Claims werden extrahiert.
Mehrfach erwähnte Entitäten werden auf gemeinsame Identitäten abgebildet.
Knoten, Kanten, Attribute und Quellen werden verbunden.
Eng zusammenhängende Graphbereiche werden geclustert.
Cluster oder Communities können zusätzlich verdichtet werden.
Graph-, Text- und Vector-Indizes unterstützen spätere Query-Pfade.
Microsoft GraphRAG
Entity Graph und Community Reports für lokale und globale Fragen
Die 2024 veröffentlichte Microsoft-GraphRAG-Arbeit fokussiert insbesondere Fragen, die eine breitere Sicht über einen gesamten Dokumentkorpus benötigen. Dafür werden aus Texten Entitäten und Beziehungen extrahiert, Communities im Graphen identifiziert und zusammenfassende Community Reports erzeugt.
Kernkomponenten
- Text Units
- Segmentierte Ausgangstexte, aus denen Entitäten und Beziehungen extrahiert werden
- Entity Graph
- Netzwerk der erkannten Entitäten und ihrer Beziehungen
- Community Detection
- Hierarchische Gruppierung eng verbundener Graphbereiche
- Community Reports
- Zusammenfassende Repräsentationen der Inhalte einer Community
- Local Search
- Fokussiert auf konkrete Entitäten und deren lokale Graphumgebung
- Global Search
- Verwendet Community Reports für Fragen nach Themen und Mustern über den gesamten Korpus
Query-Typen
Nicht jede Frage benötigt denselben Retrieval-Pfad
Konkrete Entität oder Beziehung
Retrieval startet bei wenigen relevanten Entitäten und deren Nachbarschaft.
Mehrere Beziehungen kombinieren
Eine Antwort entsteht über mehrere Kanten und Wissensobjekte hinweg.
Gesamten Korpus verstehen
Übergeordnete Themen und Muster besitzen häufig keinen einzelnen semantisch besten Textchunk.
Breite und Detail verbinden
Community- beziehungsweise Graphwissen kann gezielte lokale oder textbasierte Retrieval-Schritte auslösen.
Graph Retrieval
Retrieval kann mehr als semantische Ähnlichkeit verwenden
Passende Entitäten zur Nutzerfrage identifizieren.
Direkt verbundene Knoten und Relationen als Kontext erweitern.
Mehrstufige Beziehungspfade zwischen Entitäten bestimmen.
Einen zusammenhängenden Teilgraphen als Evidenzraum auswählen.
Relevante Cluster oder deren Zusammenfassungen bestimmen.
Knoten, Kanten oder Tripel priorisieren.
Graphstruktur mit Embedding- beziehungsweise Textähnlichkeit kombinieren.
Traversal, Ranking oder Verfahren wie Personalized PageRank einsetzen.
Beispiel
Eine Produktfrage, deren Antwort über mehrere Beziehungen verteilt ist
Beispielhafte Graphstruktur
- Nutzerfrage
- „Welche Kameras sind für Objektiv X geeignet und zugleich wettergeschützt?“
- Relation 1
- Kamera → besitzt Anschluss → Mount M
- Relation 2
- Objektiv X → kompatibel mit → Mount M
- Attribut
- Kamera → Gehäuseschutz → wetterabgedichtet
- Grounding
- Jede technische Aussage verweist auf Produktdaten beziehungsweise Herstellerquelle
- Retrieval
- GraphRAG verbindet Kompatibilitätsrelation und Produkteigenschaft, statt nur einzelne ähnliche Produkttexte zu suchen
- Antwort
- Nur Items, für die beide Bedingungen belegt sind, werden als Kandidaten ausgegeben
Nutzeranforderung → Produkt → Schnittstelle ← Zubehör
Produkt → Schutzattribut → Evidenz
Graph-Typen
GraphRAG kann auf unterschiedlichen Graphrepräsentationen basieren
Explizite fachliche Entitäten und Relationen
Ein vorhandener Knowledge Graph kann direkt als strukturierte Retrieval- und Evidenzquelle genutzt werden.
Graph aus unstrukturierten Dokumenten
Entitäten und Beziehungen werden während der Indexierung mit NLP- oder LLM-Verfahren extrahiert.
Textsegmente als Knoten
Kanten können semantische, dokumentarische oder andere Beziehungen zwischen Textpassagen repräsentieren.
Entitäten, Text und Vektoren verbinden
Viele Verfahren kombinieren Knowledge-Graph-Struktur mit Vector Retrieval und originalen Quellpassagen.
Grounding
Graphbeziehungen sollten auf Quellen zurückführbar bleiben
Ein Graph kann Wissen stark verdichten. Für belastbare Antworten ist entscheidend, dass extrahierte Entitäten und Relationen nicht von ihrer ursprünglichen Evidenz entkoppelt werden.
Welche Aussage erzeugt das LLM?
Welche Knoten, Attribute oder Relationen stützen den Claim?
Welche Passage oder Datenzeile bestätigt den Graphfakt?
Aus welchem Dokument oder System stammt die Evidenz?
Für welche Version, Zeit oder Entität gilt die Aussage?
Antwort kann auf die Ursprungsquelle verweisen.
Stärken
Wann GraphRAG gegenüber reinem Chunk Retrieval Vorteile haben kann
Beziehungen explizit nutzen
Graphen modellieren nicht nur Ähnlichkeit, sondern wie Entitäten miteinander verbunden sind.
Verteilte Evidenz zusammenführen
Mehrere Knoten und Kanten können die Informationsbasis einer komplexen Antwort bilden.
Korpusweite Muster erkennen
Communities und hierarchische Zusammenfassungen machen übergeordnete Themen zugänglich.
Informationen um Entitäten gruppieren
Mehrere Erwähnungen derselben Entität können über Dokumentgrenzen hinweg verbunden werden.
Nachbarschaften explorieren
Von einem bekannten Objekt aus können verwandte Entitäten und Beziehungen erschlossen werden.
Kontext kohärenter organisieren
Retrieved Context kann entlang von Entities, Paths oder Communities statt nur als unsortierte Top-k-Chunks aufgebaut werden.
Grenzen
GraphRAG verschiebt einen Teil der Komplexität in Indexierung und Wissensmodellierung
Typische Herausforderungen
- Extraction Error
- Entitäts- und Relationsextraktion kann falsche oder unvollständige Graphfakten erzeugen
- Entity Resolution
- Synonyme, Mehrfachnamen und gleichnamige Objekte müssen korrekt zusammengeführt oder getrennt werden
- Relation Noise
- Zu viele schwache oder unpräzise Kanten können Retrieval verschlechtern
- Schema Bias
- Das gewählte Graphschema beeinflusst, welche Fragen später gut beantwortet werden können
- Index Cost
- Graphkonstruktion, LLM-Extraktion und Community Summaries können deutlich teurer sein als einfache Chunk-Embeddings
- Update Cost
- Neue Dokumente können Graph, Communities, Summaries und Indizes verändern
- Summary Loss
- Community Reports und andere Verdichtungen können Detailinformation verlieren
- Traversal Explosion
- Große Graphen besitzen sehr viele mögliche Pfade und benötigen strikte Retrieval-Budgets
- Not Always Necessary
- Für einfache lokale Faktenfragen kann klassisches Vector RAG kostengünstiger und ausreichend sein
Measurement
GraphRAG sollte Graph-, Retrieval- und Antwortqualität getrennt messen
Wie viele extrahierte beziehungsweise retrievte Entitäten sind korrekt und relevant?
Wie zuverlässig repräsentieren Graphkanten tatsächliche Beziehungen?
Wird die für eine korrekte Antwort notwendige Quellinformation gefunden?
Werden notwendige mehrstufige Verbindungen erfasst?
Werden für globale Fragen die relevanten Bereiche des Korpus berücksichtigt?
Werden Antwortclaims durch Graph- und Quellevidenz gestützt?
Deckt eine globale Antwort die wichtigen Aspekte ausreichend breit ab?
Enthält die Antwort verschiedene relevante Aspekte statt redundanter Einzelinformationen?
Welche Compute- und LLM-Kosten entstehen beim Aufbau beziehungsweise Update?
Wie viel Laufzeit verursachen Entity Matching, Traversal, Ranking und Context Assembly?
Verwandte Ansätze
Graphbasierte Retrieval-Systeme setzen unterschiedliche Schwerpunkte
Communities und globale Sensemaking-Fragen
Entity Graph, Community Detection und Community Reports machen Informationen auf mehreren Abstraktionsebenen zugänglich.
Question Answering über textuelle Graphen
Wählt für GraphQA relevante Teile eines Textgraphen und einen zusammenhängenden Subgraphen als Kontext.
Dual-Level Graph Retrieval
Kombiniert Graphstrukturen mit Vector Retrieval und Retrieval auf unterschiedlichen Wissensebenen.
Graph Retrieval als Long-Term Memory
Verbindet LLMs, Knowledge Graphs und Personalized PageRank für assoziatives und Multi-Hop Retrieval.
Tripel Retrieval und Reranking
Ruft Knowledge-Graph-Tripel ab und priorisiert sie für generative Fragebeantwortung.
Verwandte hierarchische Retrieval-Idee
Kein klassischer GraphRAG-Ansatz, aber ein verwandtes Prinzip mit Clustering und Zusammenfassungen auf mehreren Abstraktionsebenen.
Abgrenzung
GraphRAG ergänzt andere Retrieval- und Wissensansätze
Ähnlichkeit zwischen Query und Text
Primäres Retrieval-Signal ist semantische beziehungsweise lexikalische Nähe zwischen Anfrage und Textpassagen.
Zusammenhang zwischen Wissensobjekten
Graphstruktur erweitert Retrieval um Identitäten, Beziehungen, Pfade und Communities.
Strukturierte Graphabfrage
Knowledge Graph QA kann ohne generatives RAG existieren; GraphRAG verbindet Graph Retrieval zusätzlich mit LLM-Kontext und freier Antworterzeugung.
Item-zentriertes Produktwissen
ItemRAG kann Graphstrukturen nutzen, fokussiert aber stärker auf Items, Attribute und produktbezogene Fragen.
Hierarchische Textzusammenfassungen
RAPTOR organisiert Text rekursiv in einer Baumstruktur; GraphRAG fokussiert expliziter auf Entitäten und relationale Verbindungen.
Mehr Rohinformation in einem Prompt
Ein großes Context Window erhöht Kapazität, ersetzt aber nicht automatisch strukturiertes Retrieval und relationale Auswahl.
Vorgehensweise
Eine generische GraphRAG-Implementierung in acht Schritten
Use Cases definieren
Festlegen, welche lokalen, relationalen oder globalen Fragen das System beantworten soll.
Graphmodell bestimmen
Entitäten, Relationen, Attribute und Provenance-Felder fachlich definieren.
Graph aufbauen
Strukturierte Daten übernehmen oder Entitäten und Beziehungen aus Dokumenten extrahieren.
Identitäten bereinigen
Synonyme, Dubletten, Varianten und Mehrdeutigkeiten über Entity Resolution behandeln.
Retrieval entwerfen
Entity Matching, Traversal, Graph Ranking, Vector Search und Community Retrieval kombinieren.
Context Assembly
Graphwissen gemeinsam mit Originalquellen auf das notwendige Tokenbudget verdichten.
Grounding erzwingen
Antwortclaims auf Graphfakten und deren ursprüngliche Evidenz zurückführen.
Getrennt evaluieren
Graphqualität, Retrieval, Multi-Hop Coverage, Groundedness, Kosten und Antwortqualität separat messen.
Verwandte Entitäten
Welche Leadterion-Wissensobjekte stehen in direkter Beziehung?
Retrieval-Augmented Generation
RAG bildet das übergeordnete Prinzip. GraphRAG erweitert Retrieval und Context Assembly um explizite Graphstrukturen.
Wissensbeitrag öffnenItemRAG
ItemRAG verwendet strukturierte Produktobjekte und kann Knowledge-Graph-Relationen für Kompatibilität, Varianten oder Produktfamilien nutzen.
Wissensbeitrag öffnenGroundedness & Faithfulness
GraphRAG benötigt nicht nur passende Graphpfade, sondern eine belastbare Verbindung von Graphfakten zur ursprünglichen Evidenz.
Wissensbeitrag öffnenContext Engineering
Graph Retrieval ist eine Methode, den aktiven LLM-Kontext gezielt mit strukturierter und zusammenhängender Information aufzubauen.
Wissensbeitrag öffnenProduct Attribute Coverage
Bei Produktgraphen bestimmt die Vollständigkeit von Attributen und Quellen, welche Auswahlfragen zuverlässig beantwortet werden können.
Wissensbeitrag öffnenLarge Language Models
Das LLM bleibt Generator beziehungsweise Reasoning-Baustein, während GraphRAG zusätzliche strukturierte Information zur Laufzeit bereitstellt.
Wissensbeitrag öffnenFAQ
Häufige Fragen zu GraphRAG
Was ist GraphRAG?
GraphRAG ist eine Familie von Retrieval-Augmented-Generation-Verfahren, die Graphstrukturen wie Entitäten, Beziehungen, Pfade oder Communities für Retrieval und Kontextaufbau verwenden.
Was ist der Unterschied zwischen GraphRAG und klassischem RAG?
Klassisches RAG ruft häufig einzelne Textchunks anhand semantischer oder lexikalischer Ähnlichkeit ab. GraphRAG kann zusätzlich explizite Beziehungen und mehrstufige Verbindungen zwischen Wissensobjekten nutzen.
Braucht GraphRAG immer einen bestehenden Knowledge Graph?
Nein. Ein Graph kann aus einer vorhandenen strukturierten Wissensbasis stammen oder erst während der Indexierung aus unstrukturierten Dokumenten erzeugt werden.
Was sind Local und Global Search bei Microsoft GraphRAG?
Local Search fokussiert stärker auf konkrete Entitäten und deren Umgebung. Global Search verwendet hierarchische Community Reports, um übergeordnete Fragen über einen größeren Datenbestand zu beantworten.
Was ist eine Community in GraphRAG?
Eine Community ist eine Gruppe besonders eng miteinander verbundener Knoten. Solche Cluster können übergreifende Themen oder Teilstrukturen eines Knowledge Graphs repräsentieren.
Wann ist GraphRAG besonders sinnvoll?
Vor allem wenn Antworten Beziehungen zwischen mehreren Entitäten, mehrstufige Evidenz oder ein breites Verständnis eines gesamten Dokumentbestands benötigen.
Ist GraphRAG immer besser als Vector RAG?
Nein. Graphaufbau und Traversal verursachen zusätzliche Komplexität und Kosten. Für einfache lokale Faktenfragen kann klassisches Vector Retrieval schneller und ausreichend sein.
Kann GraphRAG halluzinieren?
Ja. Fehler können bei Graphkonstruktion, Retrieval und Generation entstehen. Deshalb sollten Graphrelationen möglichst mit Originalquellen verbunden und Antwortclaims auf diese Evidenz zurückgeführt werden.
Wie wird GraphRAG evaluiert?
Sinnvoll ist eine getrennte Bewertung von Entity- und Relationsqualität, Retrieval Recall, Multi-Hop Coverage, Answer Groundedness, Comprehensiveness, Kosten und Latenz.
Quellen
Wissenschaftliche Grundlagen zu GraphRAG und graphbasiertem Retrieval
Die Auswahl verbindet die ursprüngliche Microsoft-GraphRAG-Arbeit mit systematischen Surveys und weiteren graphbasierten Retrieval-Ansätzen.
| Quelle | Autoren / Jahr | Einordnung | Originalquelle |
|---|---|---|---|
| From Local to Global: A Graph RAG Approach to Query-Focused Summarization | Darren Edge et al. · 2024 | Zentrale Microsoft-GraphRAG-Arbeit. Aus einem Dokumentkorpus wird ein Entity Knowledge Graph aufgebaut, dessen Communities zusammengefasst werden. Besonders adressiert werden globale Sensemaking-Fragen. | arXiv:2404.16130 |
| Graph Retrieval-Augmented Generation: A Survey | Boci Peng et al. · 2024 | Systematisiert GraphRAG in Graph-Based Indexing, Graph-Guided Retrieval und Graph-Enhanced Generation. | arXiv:2408.08921 |
| Retrieval-Augmented Generation with Graphs (GraphRAG) | Haoyu Han et al. · 2025 | Breiter Survey über Query Processor, Retriever, Organizer, Generator und graphstrukturierte Datenquellen. | arXiv:2501.00309 |
| A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models | Qinggang Zhang et al. · 2025 | Fokussiert graphstrukturierte Wissensrepräsentation, graphbasiertes Retrieval und Knowledge Integration für domänenspezifische LLM-Anwendungen. | arXiv:2501.13958 |
| G-Retriever: Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering | Xiaoxin He et al. · 2024 | Entwickelt einen RAG-Ansatz für textuelle Graphen und wählt relevante Subgraphen für Graph Question Answering aus. | arXiv:2402.07630 |
| LightRAG: Simple and Fast Retrieval-Augmented Generation | Zirui Guo et al. · 2024 | Kombiniert Graphstrukturen mit Vector Retrieval und verwendet Retrieval auf unterschiedlichen Wissensebenen. | arXiv:2410.05779 |
| HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models | Bernal Jiménez Gutiérrez et al. · 2024 | Kombiniert LLMs, Knowledge Graphs und Personalized PageRank für assoziatives beziehungsweise Multi-Hop Retrieval. | arXiv:2405.14831 |
| KG-Rank: Enhancing Large Language Models for Medical QA with Knowledge Graphs and Ranking Techniques | Rui Yang et al. · 2024 | Ruft Tripel aus einem medizinischen Knowledge Graph ab und priorisiert sie mit Ranking- und Reranking-Verfahren für generative Fragebeantwortung. | ACL Anthology |
| RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval | Parth Sarthi et al. · 2024 | Verwandter hierarchischer Retrieval-Ansatz: Textchunks werden rekursiv geclustert und zusammengefasst, sodass Retrieval auf mehreren Abstraktionsebenen erfolgen kann. | arXiv:2401.18059 |
Wissen
GraphRAG macht aus isolierten Fundstellen ein Netzwerk aus Entitäten, Beziehungen und Evidenz
Der entscheidende Mehrwert entsteht dort, wo eine Antwort nicht in einem einzelnen Textchunk steckt. Graphstrukturen können Informationen über Dokumentgrenzen hinweg verbinden, relevante Pfade sichtbar machen und sowohl lokale Detailfragen als auch übergeordnete Fragen über größere Wissensbestände unterstützen.