Wissen
Groundedness & Faithfulness
Groundedness und Faithfulness beschreiben, wie belastbar generierte Aussagen mit ihrer Informationsgrundlage verbunden sind. Besonders in RAG-Systemen reicht es nicht, eine plausible oder sogar faktisch richtige Antwort zu erzeugen. Entscheidend ist zusätzlich, ob die einzelnen Aussagen durch den bereitgestellten Kontext gestützt werden, ob sie den Quellen treu bleiben und ob sich Claims nachvollziehbar auf konkrete Evidenz zurückführen lassen.
Lassen sich Antwort-Claims auf konkrete Evidenz im bereitgestellten Kontext zurückführen?
Bleibt die Antwort den Quellen treu, ohne zusätzliche ungestützte oder widersprechende Aussagen einzuführen?
Groundedness und Faithfulness sind nicht identisch mit allgemeiner factual correctness oder Wahrheit.
Dokument-Metadaten
Worum geht es in diesem Wissensbeitrag?
Einordnung des Inhalts
- Entity Class
- Wissen
- Content-Typ
- Ratgeber / technischer Wissensbeitrag
- Hauptthema
- Groundedness & Faithfulness
- Themenkategorie
- LLM Evaluation / Retrieval-Augmented Generation / Factual Consistency
- Primäres Messobjekt
- Beziehung zwischen generierten Aussagen und bereitgestellter Evidenz
- Typische Systeme
- RAG, Search Assistants, Product QA, Conversational AI, Agenten und wissensgestützte LLM-Anwendungen
- Kernfrage
- Welche Aussagen einer Antwort werden durch welche Quelle tatsächlich gestützt?
Definition
Was bedeuten Groundedness und Faithfulness?
Die Terminologie ist in Forschung und Praxis nicht vollständig standardisiert. Besonders in RAG-Evaluationsframeworks werden Groundedness, Faithfulness und Factual Consistency teilweise überlappend verwendet. Für eine praktische Systembewertung ist deshalb eine explizite Definition wichtiger als der Name der Kennzahl.
Arbeitsdefinition für LLM- und RAG-Systeme
- Groundedness
- Grad, zu dem ein Claim der Antwort durch konkrete Informationen im definierten Kontext oder in zugeordneten Quellen gestützt wird.
- Faithfulness
- Grad, zu dem die Antwort die Bedeutung ihrer Informationsgrundlage korrekt wiedergibt und keine ungestützten Ergänzungen, Übertreibungen oder Widersprüche einführt.
- Factual Correctness
- Grad, zu dem eine Aussage mit der tatsächlichen Außenwelt beziehungsweise einer verlässlichen Referenz übereinstimmt.
- Answer Relevance
- Grad, zu dem die Antwort tatsächlich die Nutzerfrage beantwortet. Eine vollständig grounded Antwort kann trotzdem irrelevant sein.
- Context Relevance
- Grad, zu dem das Retrieval die für die Nutzerfrage notwendigen und hilfreichen Informationen bereitstellt.
Bewertungsmodell
Von der Nutzerfrage zum evidenzgestützten Claim
Groundedness lässt sich am saubersten auf Claim-Ebene bewerten. Eine Antwort wird dafür in einzelne überprüfbare Aussagen zerlegt, die anschließend gegen den tatsächlich verfügbaren Kontext geprüft werden.
Welche Information oder Entscheidung benötigt der Nutzer?
Welche Quellen und Passagen werden als Kontext bereitgestellt?
Das Modell erzeugt eine zusammenhängende Antwort.
Die Antwort wird in atomare beziehungsweise prüfbare Aussagen zerlegt.
Für jeden Claim werden relevante Kontextstellen identifiziert.
Supported, Contradicted, Unsupported oder Unclear.
Ein aggregierter Wert beschreibt Groundedness beziehungsweise Faithfulness.
Abgrenzung
Richtig, grounded und faithful sind drei unterschiedliche Eigenschaften
Idealfall
Die Aussage ist durch die bereitgestellte Quelle gestützt und stimmt zugleich mit einer verlässlichen Außenwelt-Referenz überein.
Wissen aus dem Modell
Das Modell nennt einen korrekten Fakt, der im bereitgestellten Kontext jedoch nicht vorkommt. Für eine strikt evidenzbasierte RAG-Antwort bleibt dieser Claim ungrounded.
Fehlerhafte Quelle
Die Antwort gibt die Quelle korrekt wieder, aber die Quelle selbst ist veraltet, fehlerhaft oder unzuverlässig. Faithfulness schützt deshalb nicht automatisch vor falscher Weltinformation.
Überinterpretation
Die Quelle enthält einen schwächeren oder eingeschränkten Claim, während das Modell daraus eine stärkere, allgemeinere Aussage erzeugt.
Claim-Ebene
Nicht jeder Satz ist eine einzelne überprüfbare Aussage
Lange Antworten können gleichzeitig richtige, gestützte und ungestützte Aussagen enthalten. Deshalb sind atomare beziehungsweise feingranulare Claims für Evaluation meist aussagekräftiger als eine einzige Bewertung der gesamten Antwort.
Beispielhafte Claim-Klassifikation
- Supported
- Die bereitgestellte Evidenz unterstützt den Claim direkt oder mit klar zulässiger Schlussfolgerung.
- Contradicted
- Die Evidenz widerspricht dem Claim oder nennt einen inkompatiblen Wert beziehungsweise Zustand.
- Unsupported
- Der Claim ist in der Antwort vorhanden, kann aber aus der bereitgestellten Evidenz nicht begründet werden.
- Partially Supported
- Ein Teil der Aussage ist gedeckt, während zusätzliche Details oder Verallgemeinerungen nicht belegt sind.
- Unclear
- Die Quelle ist zu unpräzise, mehrdeutig oder unvollständig, um den Claim eindeutig zu bestätigen oder abzulehnen.
Grounding Chain
Eine Citation ist erst dann nützlich, wenn sie den konkreten Claim stützt
Die bloße Existenz einer Quellenangabe beweist noch keine Groundedness. Entscheidend ist die Beziehung zwischen Aussage, Evidenz, Quelle, Version und Gültigkeitskontext.
Welche konkrete Aussage wird in der Antwort gemacht?
Welche Passage oder welches Datenfeld soll den Claim stützen?
Aus welchem Dokument, Datensatz oder System stammt die Evidenz?
Auf welches Produkt, Unternehmen, Ereignis oder Objekt bezieht sie sich?
Für welche Variante, Region, Version oder Zeit gilt der Claim?
Die generierte Formulierung darf nicht stärker sein als die Evidenz.
Beispiel
Produktfrage: „Ist diese Kamera regenfest?“
Grounded versus ungrounded formuliert
- Quelle
- Herstellerdokumentation nennt ein wetterabgedichtetes Gehäuse, macht aber keine Aussage zu vollständiger Wasserdichtigkeit.
- Faithful Claim
- Die Kamera verfügt laut Hersteller über ein wetterabgedichtetes Gehäuse.
- Ungestützte Erweiterung
- Die Kamera ist vollständig wasserdicht und kann problemlos dauerhaft starkem Regen ausgesetzt werden.
- Fehlerursache
- Das Modell übersetzt eine begrenzte Herstellerangabe in einen wesentlich stärkeren technischen Claim.
- Grounded Antwortstrategie
- Herstellerangabe präzise wiedergeben, fehlende Schutzklasse transparent benennen und keine nicht belegte Wasserdichtigkeit ableiten.
RAG Evaluation
Retrieval-Qualität und Generation-Qualität müssen getrennt werden
Hat Retrieval die richtigen Informationen gefunden?
Wenn relevante Evidenz nicht im Kontext landet, kann selbst ein sehr faithful Generator die Nutzerfrage nicht vollständig beantworten.
Bleibt die Antwort beim gefundenen Kontext?
Die Generation sollte keine zusätzlichen Claims einführen, die aus dem Retrieval-Kontext nicht gestützt werden können.
Beantwortet die Antwort die Frage?
Eine Antwort kann vollständig grounded sein und trotzdem an der Nutzerintention vorbeigehen.
Ist die Aussage auch außerhalb des RAG-Kontexts richtig?
Diese Prüfung benötigt eine vertrauenswürdige Referenz oder zusätzliche externe Verifikation.
Measurement
Wie lassen sich Groundedness und Faithfulness messen?
Anteil der überprüfbaren Antwort-Claims, die durch die bereitgestellte Evidenz gestützt werden.
Anteil der Claims, für die im definierten Kontext keine ausreichende Evidenz vorhanden ist.
Anteil der Claims, die dem bereitgestellten Kontext ausdrücklich widersprechen.
Prüft, ob die einer Aussage zugeordnete Citation deren Inhalt tatsächlich unterstützt.
Lange Antworten werden in kleine Fakten zerlegt und jede Einheit wird separat auf Evidenz geprüft.
Automatische Evaluatoren sollten gegen menschliche Bewertungen kalibriert und regelmäßig auditiert werden.
Groundedness Rate = unterstützte prüfbare Claims ÷ alle prüfbaren Claims
Evaluationsmethoden
Mehrere Verfahren können dieselbe Qualitätsdimension prüfen
Folgt der Claim aus der Evidenz?
Ein Modell bewertet, ob ein Quellenabschnitt die Antwortaussage unterstützt, ihr widerspricht oder neutral zu ihr ist.
Kann dieselbe Information aus Quelle und Antwort abgeleitet werden?
QA-basierte Metriken generieren Fragen aus Aussagen und vergleichen, ob Quelle und Antwort konsistente Antworten liefern.
Feingranulare Fakten statt Gesamturteil
Eine lange Generation wird in einzelne Fakten zerlegt, die anschließend separat verifiziert werden.
Modellbasierte Bewertung
Ein separates Sprachmodell beurteilt Claim-Evidence-Paare. Das skaliert gut, benötigt aber Validierung gegen menschliche Labels.
Antworten gegeneinander prüfen
Mehrere stochastische Antworten desselben Modells können auf Widersprüche und instabile Fakten untersucht werden.
Referenz für kritische Fälle
Bei komplexen, risikoreichen oder fachlich mehrdeutigen Claims bleibt menschliche Prüfung eine wichtige Validierungsstufe.
Failure Modes
Typische Ursachen ungrounded oder unfaithful Antworten
Fehlerklassen
- Retrieval Failure
- Die notwendige Evidenz wurde nicht gefunden oder nicht in den Kontext aufgenommen.
- Unsupported Addition
- Das Modell ergänzt plausibel klingende Details, die in keiner Quelle vorhanden sind.
- Contradiction
- Die Antwort nennt einen Wert oder Sachverhalt, der dem Kontext widerspricht.
- Overgeneralization
- Eine eingeschränkte Aussage wird auf einen größeren Gültigkeitsbereich ausgeweitet.
- Entity Mix-up
- Ein Fakt wird dem falschen Produkt, Unternehmen, Dokument oder einer falschen Variante zugeordnet.
- Citation Mismatch
- Eine Quelle wird zwar zitiert, stützt aber den unmittelbar davor oder danach stehenden Claim nicht.
- Stale Evidence
- Die Antwort bleibt einer veralteten Quelle treu und ist dadurch aktuell dennoch falsch.
- Compound Claim
- Ein Satz enthält mehrere Teilbehauptungen, von denen nur einige durch die Evidenz gedeckt sind.
- Inference Leap
- Das Modell macht einen zusätzlichen Schluss, der zwar möglich, aber aus der Quelle nicht ausreichend zwingend ableitbar ist.
Source Quality
Groundedness bewertet die Beziehung zur Quelle – nicht automatisch die Qualität der Quelle
Ein RAG-System benötigt deshalb mindestens zwei getrennte Prüfungen: Ist die Antwort durch die Quelle gestützt? Und ist die Quelle selbst geeignet, aktuell und vertrauenswürdig?
Ist die Quelle für den konkreten Sachverhalt fachlich geeignet?
Handelt es sich um eine Primärquelle oder nur um eine sekundäre Wiedergabe?
Ist die Information für den relevanten Zeitpunkt noch aktuell?
Bezieht sich die Quelle wirklich auf das richtige Objekt oder die richtige Variante?
Gelten Aussagen nur für bestimmte Regionen, Versionen oder Bedingungen?
Kann der Weg von der Antwort bis zum Ursprung der Information nachvollzogen werden?
Vorgehensweise
Groundedness systematisch in einem LLM-System prüfen
Antwortclaims extrahieren
Die generierte Antwort wird in möglichst atomare überprüfbare Aussagen zerlegt.
Evidenz zuordnen
Jedem Claim werden die tatsächlich relevanten Passagen, Datenfelder oder Quellen zugeordnet.
Entailment prüfen
Das System bewertet, ob die Evidenz den Claim stützt, ihm widerspricht oder keine ausreichende Information enthält.
Quelle prüfen
Aktualität, Autorität, Entity Match und Gültigkeitsbedingungen werden separat von Groundedness bewertet.
Antwort begrenzen
Unsupported Claims werden entfernt, abgeschwächt oder transparent als unsicher gekennzeichnet.
Evaluation kalibrieren
Automatische Scores werden mit menschlichen Stichproben und realen Failure Cases überprüft.
Anwendungsfälle
Wo Groundedness besonders relevant ist
Wissensgestützte Antworten
Prüfen, ob Antworten tatsächlich aus den retrievten Unternehmens-, Fach- oder Dokumentquellen ableitbar sind.
Produktclaims
Produktaussagen werden auf konkrete Attribute, Werte, Varianten und Herstellerquellen zurückgeführt.
Beratung und Auswahl
Empfehlungen sollten auf belastbaren Produkt-, Verfügbarkeits- und Policy-Daten beruhen.
Citations und AI Search
Eine Citation ist nur dann wertvoll, wenn die Quelle den generierten Claim tatsächlich stützt.
Tool- und Research-Ergebnisse
Schlussfolgerungen aus Such-, Datenbank- oder Tool-Ergebnissen müssen auf die jeweiligen Beobachtungen zurückgeführt werden können.
Risikoreiche Information
Bei medizinischen, finanziellen oder sicherheitskritischen Aussagen steigt die Bedeutung präziser Evidenzzuordnung.
Grenzen
Groundedness-Scores sind selbst nur Messmodelle
Was bei der Interpretation zu beachten ist
- Terminologie
- Groundedness, Faithfulness und Factual Consistency werden nicht in allen Frameworks identisch definiert.
- Judge Error
- NLI-Modelle und LLM Judges können selbst falsche Support- beziehungsweise Contradiction-Urteile erzeugen.
- Claim Decomposition
- Unterschiedliche Zerlegung derselben Antwort kann den resultierenden Score verändern.
- Implicit Reasoning
- Manche Aussagen benötigen mehrere Evidenzstücke oder fachlich zulässige Schlussfolgerungen statt einer direkten Textübereinstimmung.
- Source Truth
- Ein hoher Groundedness-Wert beweist nicht, dass die verwendete Quelle selbst richtig ist.
- Business Criticality
- Zehn triviale korrekte Claims können einen einzigen kritischen falschen Claim nicht automatisch kompensieren.
Verwandte Entitäten
Welche Leadterion-Wissensobjekte stehen in direkter Beziehung?
Retrieval-Augmented Generation
RAG stellt externes Wissen als Kontext bereit. Groundedness bewertet anschließend, ob die Antwort dieses Wissen tatsächlich korrekt und nachvollziehbar verwendet.
Wissensbeitrag öffnenItemRAG
Bei ItemRAG kann Grounding auf strukturierte Produktattribute, Relationen, Varianten und einzelne Datenquellen heruntergebrochen werden.
Wissensbeitrag öffnenProduct Attribute Coverage
Fehlende oder unbelegte Produktattribute begrenzen, welche produktbezogenen Claims überhaupt grounded erzeugt werden können.
Wissensbeitrag öffnenE-E-A-T
Groundedness beantwortet, ob eine Quelle einen Claim stützt. E-E-A-T und verwandte Qualitätskonzepte adressieren zusätzlich, wie vertrauenswürdig beziehungsweise geeignet die Quelle ist.
Wissensbeitrag öffnenGEO-KPIs
Citation Frequency sollte um Citation-Evidence-Qualität ergänzt werden: Wird eine Quelle nur genannt oder stützt sie den entsprechenden Claim?
Wissensbeitrag öffnenLarge Language Models
Der Grundlagenbeitrag erklärt, warum autoregressive Sprachmodelle plausible Tokenfolgen generieren können, ohne dadurch automatisch faktische oder evidenzgestützte Antworten zu garantieren.
Wissensbeitrag öffnenFAQ
Häufige Fragen zu Groundedness & Faithfulness
Was ist Groundedness bei einem LLM?
Groundedness beschreibt, ob Aussagen einer generierten Antwort auf konkrete Evidenz im bereitgestellten Kontext oder in definierten Quellen zurückgeführt werden können.
Was ist Faithfulness?
Faithfulness beschreibt, ob eine generierte Antwort ihrer Informationsgrundlage treu bleibt und keine nicht gestützten, widersprechenden oder übermäßig verallgemeinerten Claims ergänzt.
Sind Groundedness und Faithfulness dasselbe?
Die Begriffe werden in Forschung und Praxis teilweise überlappend verwendet. Für eine belastbare Evaluation sollte deshalb immer explizit definiert werden, welche Claim-Evidence-Beziehung die jeweilige Metrik misst.
Kann eine Antwort grounded und trotzdem falsch sein?
Ja. Wenn die bereitgestellte Quelle selbst falsch oder veraltet ist, kann die Antwort diese Quelle korrekt wiedergeben und dennoch faktisch falsch sein.
Kann eine richtige Antwort ungrounded sein?
Ja. Ein Modell kann einen korrekten Fakt aus seinem Parameterwissen erzeugen, obwohl dieser Fakt nicht im bereitgestellten Kontext enthalten ist. In einer strikt source-grounded Anwendung wäre diese Aussage trotzdem nicht ausreichend belegt.
Reicht eine Citation aus, um Groundedness zu beweisen?
Nein. Die Citation muss den konkreten Claim tatsächlich unterstützen. Eine bloße Quellenangabe ohne passende Evidenz ist kein belastbares Grounding.
Wie sollte Groundedness bei langen Antworten gemessen werden?
Sinnvoll ist eine Zerlegung in einzelne überprüfbare Claims. Anschließend kann für jeden Claim separat bewertet werden, ob die relevante Evidenz ihn unterstützt, ihm widerspricht oder keine ausreichende Information enthält.
Was ist der Unterschied zu Halluzinationen?
Halluzination ist ein breiterer Begriff für generierte Inhalte, die nicht ausreichend durch verlässliche Information gestützt sind. Groundedness und Faithfulness operationalisieren konkrete Teile dieses Problems für source- oder context-basierte Systeme.
Quellen
Wissenschaftliche Arbeiten zu Faithfulness, Factual Consistency und RAG Evaluation
Die Auswahl verbindet Grundlagenarbeiten zur factual consistency mit neueren Evaluationsframeworks für Retrieval-Augmented Generation. Die jeweiligen Metriken verwenden teilweise unterschiedliche Definitionen und sollten deshalb anhand ihrer konkreten Bewertungslogik verglichen werden.
| Quelle | Autoren / Jahr | Einordnung | Originalquelle |
|---|---|---|---|
| Faithfulness in Natural Language Generation: A Systematic Survey of Analysis, Evaluation and Optimization Methods | Wei Li, Wenhao Wu, Moye Chen, Jiachen Liu, Xinyan Xiao & Hua Wu · 2022 | Systematisiert das Faithfulness-Problem in Natural Language Generation und ordnet Analyse-, Evaluations- und Optimierungsmethoden über verschiedene Generierungsaufgaben hinweg ein. | arXiv:2203.05227 |
| QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization | Alexander R. Fabbri, Chien-Sheng Wu, Wenhao Liu & Caiming Xiong · 2022 | Untersucht QA-basierte factual-consistency-Metriken und zeigt, dass Fragen- und Antwortvergleich ein leistungsfähiger Ansatz zur Prüfung der Übereinstimmung von generiertem Text und Quelle sein kann. | ACL Anthology |
| AlignScore: Evaluating Factual Consistency with a Unified Alignment Function | Yuheng Zha, Yichi Yang, Ruichen Li & Zhiting Hu · 2023 | Formuliert factual consistency als allgemeines Alignment-Problem zwischen zwei Texten und kombiniert Trainingssignale aus mehreren Aufgaben wie NLI, QA, Fact Verification und Summarization. | ACL Anthology |
| FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation | Sewon Min et al. · 2023 | Zerlegt lange Generationen in atomare Fakten und bewertet, welcher Anteil dieser Fakten durch eine verlässliche Wissensquelle gestützt werden kann. | ACL Anthology |
| SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models | Potsawee Manakul, Adian Liusie & Mark Gales · 2023 | Nutzt die Konsistenz mehrerer stochastisch erzeugter Antworten, um potenziell nicht-faktische Aussagen auch ohne externe Wissensdatenbank zu erkennen. | ACL Anthology |
| RAGAs: Automated Evaluation of Retrieval Augmented Generation | Shahul Es, Jithin James, Luis Espinosa Anke & Steven Schockaert · 2024 | Bewertet RAG-Pipelines entlang mehrerer getrennten Dimensionen, insbesondere Retrieval-Kontext und faithful Nutzung dieses Kontextes durch die generierte Antwort. | ACL Anthology |
| ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems | Jon Saad-Falcon, Omar Khattab, Christopher Potts & Matei Zaharia · 2024 | Entwickelt eine automatisierte RAG-Evaluation für Context Relevance, Answer Faithfulness und Answer Relevance und kombiniert Modell-Judges mit einer kleinen Menge menschlicher Annotationen. | ACL Anthology |
Wissen
Gute LLM-Antworten sollten nicht nur plausibel sein, sondern auf nachvollziehbarer Evidenz beruhen
Groundedness macht aus einer sprachlich überzeugenden Antwort eine überprüfbare Informationskette. Entscheidend ist, welche Aussage durch welche Evidenz gestützt wird, unter welchen Bedingungen sie gilt und wie zuverlässig die zugrunde liegende Quelle ist.