Wissen

Groundedness & Faithfulness

Groundedness und Faithfulness beschreiben, wie belastbar generierte Aussagen mit ihrer Informationsgrundlage verbunden sind. Besonders in RAG-Systemen reicht es nicht, eine plausible oder sogar faktisch richtige Antwort zu erzeugen. Entscheidend ist zusätzlich, ob die einzelnen Aussagen durch den bereitgestellten Kontext gestützt werden, ob sie den Quellen treu bleiben und ob sich Claims nachvollziehbar auf konkrete Evidenz zurückführen lassen.

  • Entity Class: Wissen
  • Content-Typ: Ratgeber
  • Hauptthema: Groundedness & Faithfulness
  • Bereich: LLM Evaluation / RAG / Grounding
Groundedness

Lassen sich Antwort-Claims auf konkrete Evidenz im bereitgestellten Kontext zurückführen?

Faithfulness

Bleibt die Antwort den Quellen treu, ohne zusätzliche ungestützte oder widersprechende Aussagen einzuführen?

Wichtige Abgrenzung

Groundedness und Faithfulness sind nicht identisch mit allgemeiner factual correctness oder Wahrheit.

Dokument-Metadaten

Worum geht es in diesem Wissensbeitrag?

Einordnung des Inhalts

Entity Class
Wissen
Content-Typ
Ratgeber / technischer Wissensbeitrag
Hauptthema
Groundedness & Faithfulness
Themenkategorie
LLM Evaluation / Retrieval-Augmented Generation / Factual Consistency
Primäres Messobjekt
Beziehung zwischen generierten Aussagen und bereitgestellter Evidenz
Typische Systeme
RAG, Search Assistants, Product QA, Conversational AI, Agenten und wissensgestützte LLM-Anwendungen
Kernfrage
Welche Aussagen einer Antwort werden durch welche Quelle tatsächlich gestützt?

Definition

Was bedeuten Groundedness und Faithfulness?

Die Terminologie ist in Forschung und Praxis nicht vollständig standardisiert. Besonders in RAG-Evaluationsframeworks werden Groundedness, Faithfulness und Factual Consistency teilweise überlappend verwendet. Für eine praktische Systembewertung ist deshalb eine explizite Definition wichtiger als der Name der Kennzahl.

Arbeitsdefinition für LLM- und RAG-Systeme

Groundedness
Grad, zu dem ein Claim der Antwort durch konkrete Informationen im definierten Kontext oder in zugeordneten Quellen gestützt wird.
Faithfulness
Grad, zu dem die Antwort die Bedeutung ihrer Informationsgrundlage korrekt wiedergibt und keine ungestützten Ergänzungen, Übertreibungen oder Widersprüche einführt.
Factual Correctness
Grad, zu dem eine Aussage mit der tatsächlichen Außenwelt beziehungsweise einer verlässlichen Referenz übereinstimmt.
Answer Relevance
Grad, zu dem die Antwort tatsächlich die Nutzerfrage beantwortet. Eine vollständig grounded Antwort kann trotzdem irrelevant sein.
Context Relevance
Grad, zu dem das Retrieval die für die Nutzerfrage notwendigen und hilfreichen Informationen bereitstellt.

Bewertungsmodell

Von der Nutzerfrage zum evidenzgestützten Claim

Groundedness lässt sich am saubersten auf Claim-Ebene bewerten. Eine Antwort wird dafür in einzelne überprüfbare Aussagen zerlegt, die anschließend gegen den tatsächlich verfügbaren Kontext geprüft werden.

01 Query

Welche Information oder Entscheidung benötigt der Nutzer?

02 Retrieval

Welche Quellen und Passagen werden als Kontext bereitgestellt?

03 Answer

Das Modell erzeugt eine zusammenhängende Antwort.

04 Claims

Die Antwort wird in atomare beziehungsweise prüfbare Aussagen zerlegt.

05 Evidence

Für jeden Claim werden relevante Kontextstellen identifiziert.

06 Judgment

Supported, Contradicted, Unsupported oder Unclear.

07 Score

Ein aggregierter Wert beschreibt Groundedness beziehungsweise Faithfulness.

Abgrenzung

Richtig, grounded und faithful sind drei unterschiedliche Eigenschaften

FAKTISCH RICHTIG + GROUNDED

Idealfall

Die Aussage ist durch die bereitgestellte Quelle gestützt und stimmt zugleich mit einer verlässlichen Außenwelt-Referenz überein.

RICHTIG, ABER NICHT GROUNDED

Wissen aus dem Modell

Das Modell nennt einen korrekten Fakt, der im bereitgestellten Kontext jedoch nicht vorkommt. Für eine strikt evidenzbasierte RAG-Antwort bleibt dieser Claim ungrounded.

GROUNDED, ABER FALSCH

Fehlerhafte Quelle

Die Antwort gibt die Quelle korrekt wieder, aber die Quelle selbst ist veraltet, fehlerhaft oder unzuverlässig. Faithfulness schützt deshalb nicht automatisch vor falscher Weltinformation.

NICHT FAITHFUL

Überinterpretation

Die Quelle enthält einen schwächeren oder eingeschränkten Claim, während das Modell daraus eine stärkere, allgemeinere Aussage erzeugt.

Claim-Ebene

Nicht jeder Satz ist eine einzelne überprüfbare Aussage

Lange Antworten können gleichzeitig richtige, gestützte und ungestützte Aussagen enthalten. Deshalb sind atomare beziehungsweise feingranulare Claims für Evaluation meist aussagekräftiger als eine einzige Bewertung der gesamten Antwort.

Beispielhafte Claim-Klassifikation

Supported
Die bereitgestellte Evidenz unterstützt den Claim direkt oder mit klar zulässiger Schlussfolgerung.
Contradicted
Die Evidenz widerspricht dem Claim oder nennt einen inkompatiblen Wert beziehungsweise Zustand.
Unsupported
Der Claim ist in der Antwort vorhanden, kann aber aus der bereitgestellten Evidenz nicht begründet werden.
Partially Supported
Ein Teil der Aussage ist gedeckt, während zusätzliche Details oder Verallgemeinerungen nicht belegt sind.
Unclear
Die Quelle ist zu unpräzise, mehrdeutig oder unvollständig, um den Claim eindeutig zu bestätigen oder abzulehnen.

Grounding Chain

Eine Citation ist erst dann nützlich, wenn sie den konkreten Claim stützt

Die bloße Existenz einer Quellenangabe beweist noch keine Groundedness. Entscheidend ist die Beziehung zwischen Aussage, Evidenz, Quelle, Version und Gültigkeitskontext.

01 Answer Claim

Welche konkrete Aussage wird in der Antwort gemacht?

02 Evidence Span

Welche Passage oder welches Datenfeld soll den Claim stützen?

03 Source

Aus welchem Dokument, Datensatz oder System stammt die Evidenz?

04 Entity

Auf welches Produkt, Unternehmen, Ereignis oder Objekt bezieht sie sich?

05 Validity

Für welche Variante, Region, Version oder Zeit gilt der Claim?

06 Answer

Die generierte Formulierung darf nicht stärker sein als die Evidenz.

Beispiel

Produktfrage: „Ist diese Kamera regenfest?“

Grounded versus ungrounded formuliert

Quelle
Herstellerdokumentation nennt ein wetterabgedichtetes Gehäuse, macht aber keine Aussage zu vollständiger Wasserdichtigkeit.
Faithful Claim
Die Kamera verfügt laut Hersteller über ein wetterabgedichtetes Gehäuse.
Ungestützte Erweiterung
Die Kamera ist vollständig wasserdicht und kann problemlos dauerhaft starkem Regen ausgesetzt werden.
Fehlerursache
Das Modell übersetzt eine begrenzte Herstellerangabe in einen wesentlich stärkeren technischen Claim.
Grounded Antwortstrategie
Herstellerangabe präzise wiedergeben, fehlende Schutzklasse transparent benennen und keine nicht belegte Wasserdichtigkeit ableiten.

RAG Evaluation

Retrieval-Qualität und Generation-Qualität müssen getrennt werden

CONTEXT RELEVANCE

Hat Retrieval die richtigen Informationen gefunden?

Wenn relevante Evidenz nicht im Kontext landet, kann selbst ein sehr faithful Generator die Nutzerfrage nicht vollständig beantworten.

FAITHFULNESS

Bleibt die Antwort beim gefundenen Kontext?

Die Generation sollte keine zusätzlichen Claims einführen, die aus dem Retrieval-Kontext nicht gestützt werden können.

ANSWER RELEVANCE

Beantwortet die Antwort die Frage?

Eine Antwort kann vollständig grounded sein und trotzdem an der Nutzerintention vorbeigehen.

CORRECTNESS

Ist die Aussage auch außerhalb des RAG-Kontexts richtig?

Diese Prüfung benötigt eine vertrauenswürdige Referenz oder zusätzliche externe Verifikation.

Measurement

Wie lassen sich Groundedness und Faithfulness messen?

Claim Support Rate

Anteil der überprüfbaren Antwort-Claims, die durch die bereitgestellte Evidenz gestützt werden.

Unsupported Claim Rate

Anteil der Claims, für die im definierten Kontext keine ausreichende Evidenz vorhanden ist.

Contradiction Rate

Anteil der Claims, die dem bereitgestellten Kontext ausdrücklich widersprechen.

Citation Entailment

Prüft, ob die einer Aussage zugeordnete Citation deren Inhalt tatsächlich unterstützt.

Atomic Fact Support

Lange Antworten werden in kleine Fakten zerlegt und jede Einheit wird separat auf Evidenz geprüft.

Human Agreement

Automatische Evaluatoren sollten gegen menschliche Bewertungen kalibriert und regelmäßig auditiert werden.

Einfaches operatives Modell
Groundedness Rate = unterstützte prüfbare Claims ÷ alle prüfbaren Claims

Evaluationsmethoden

Mehrere Verfahren können dieselbe Qualitätsdimension prüfen

ENTAILMENT / NLI

Folgt der Claim aus der Evidenz?

Ein Modell bewertet, ob ein Quellenabschnitt die Antwortaussage unterstützt, ihr widerspricht oder neutral zu ihr ist.

QUESTION ANSWERING

Kann dieselbe Information aus Quelle und Antwort abgeleitet werden?

QA-basierte Metriken generieren Fragen aus Aussagen und vergleichen, ob Quelle und Antwort konsistente Antworten liefern.

ATOMIC FACTS

Feingranulare Fakten statt Gesamturteil

Eine lange Generation wird in einzelne Fakten zerlegt, die anschließend separat verifiziert werden.

LLM-AS-A-JUDGE

Modellbasierte Bewertung

Ein separates Sprachmodell beurteilt Claim-Evidence-Paare. Das skaliert gut, benötigt aber Validierung gegen menschliche Labels.

SELF-CONSISTENCY

Antworten gegeneinander prüfen

Mehrere stochastische Antworten desselben Modells können auf Widersprüche und instabile Fakten untersucht werden.

HUMAN AUDIT

Referenz für kritische Fälle

Bei komplexen, risikoreichen oder fachlich mehrdeutigen Claims bleibt menschliche Prüfung eine wichtige Validierungsstufe.

Failure Modes

Typische Ursachen ungrounded oder unfaithful Antworten

Fehlerklassen

Retrieval Failure
Die notwendige Evidenz wurde nicht gefunden oder nicht in den Kontext aufgenommen.
Unsupported Addition
Das Modell ergänzt plausibel klingende Details, die in keiner Quelle vorhanden sind.
Contradiction
Die Antwort nennt einen Wert oder Sachverhalt, der dem Kontext widerspricht.
Overgeneralization
Eine eingeschränkte Aussage wird auf einen größeren Gültigkeitsbereich ausgeweitet.
Entity Mix-up
Ein Fakt wird dem falschen Produkt, Unternehmen, Dokument oder einer falschen Variante zugeordnet.
Citation Mismatch
Eine Quelle wird zwar zitiert, stützt aber den unmittelbar davor oder danach stehenden Claim nicht.
Stale Evidence
Die Antwort bleibt einer veralteten Quelle treu und ist dadurch aktuell dennoch falsch.
Compound Claim
Ein Satz enthält mehrere Teilbehauptungen, von denen nur einige durch die Evidenz gedeckt sind.
Inference Leap
Das Modell macht einen zusätzlichen Schluss, der zwar möglich, aber aus der Quelle nicht ausreichend zwingend ableitbar ist.

Source Quality

Groundedness bewertet die Beziehung zur Quelle – nicht automatisch die Qualität der Quelle

Ein RAG-System benötigt deshalb mindestens zwei getrennte Prüfungen: Ist die Antwort durch die Quelle gestützt? Und ist die Quelle selbst geeignet, aktuell und vertrauenswürdig?

Authority

Ist die Quelle für den konkreten Sachverhalt fachlich geeignet?

Primary Evidence

Handelt es sich um eine Primärquelle oder nur um eine sekundäre Wiedergabe?

Freshness

Ist die Information für den relevanten Zeitpunkt noch aktuell?

Entity Match

Bezieht sich die Quelle wirklich auf das richtige Objekt oder die richtige Variante?

Validity Context

Gelten Aussagen nur für bestimmte Regionen, Versionen oder Bedingungen?

Traceability

Kann der Weg von der Antwort bis zum Ursprung der Information nachvollzogen werden?

Vorgehensweise

Groundedness systematisch in einem LLM-System prüfen

01

Antwortclaims extrahieren

Die generierte Antwort wird in möglichst atomare überprüfbare Aussagen zerlegt.

02

Evidenz zuordnen

Jedem Claim werden die tatsächlich relevanten Passagen, Datenfelder oder Quellen zugeordnet.

03

Entailment prüfen

Das System bewertet, ob die Evidenz den Claim stützt, ihm widerspricht oder keine ausreichende Information enthält.

04

Quelle prüfen

Aktualität, Autorität, Entity Match und Gültigkeitsbedingungen werden separat von Groundedness bewertet.

05

Antwort begrenzen

Unsupported Claims werden entfernt, abgeschwächt oder transparent als unsicher gekennzeichnet.

06

Evaluation kalibrieren

Automatische Scores werden mit menschlichen Stichproben und realen Failure Cases überprüft.

Anwendungsfälle

Wo Groundedness besonders relevant ist

RAG

Wissensgestützte Antworten

Prüfen, ob Antworten tatsächlich aus den retrievten Unternehmens-, Fach- oder Dokumentquellen ableitbar sind.

ITEMRAG

Produktclaims

Produktaussagen werden auf konkrete Attribute, Werte, Varianten und Herstellerquellen zurückgeführt.

CONVERSATIONAL COMMERCE

Beratung und Auswahl

Empfehlungen sollten auf belastbaren Produkt-, Verfügbarkeits- und Policy-Daten beruhen.

GEO

Citations und AI Search

Eine Citation ist nur dann wertvoll, wenn die Quelle den generierten Claim tatsächlich stützt.

AGENTS

Tool- und Research-Ergebnisse

Schlussfolgerungen aus Such-, Datenbank- oder Tool-Ergebnissen müssen auf die jeweiligen Beobachtungen zurückgeführt werden können.

YMYL / HIGH STAKES

Risikoreiche Information

Bei medizinischen, finanziellen oder sicherheitskritischen Aussagen steigt die Bedeutung präziser Evidenzzuordnung.

Grenzen

Groundedness-Scores sind selbst nur Messmodelle

Was bei der Interpretation zu beachten ist

Terminologie
Groundedness, Faithfulness und Factual Consistency werden nicht in allen Frameworks identisch definiert.
Judge Error
NLI-Modelle und LLM Judges können selbst falsche Support- beziehungsweise Contradiction-Urteile erzeugen.
Claim Decomposition
Unterschiedliche Zerlegung derselben Antwort kann den resultierenden Score verändern.
Implicit Reasoning
Manche Aussagen benötigen mehrere Evidenzstücke oder fachlich zulässige Schlussfolgerungen statt einer direkten Textübereinstimmung.
Source Truth
Ein hoher Groundedness-Wert beweist nicht, dass die verwendete Quelle selbst richtig ist.
Business Criticality
Zehn triviale korrekte Claims können einen einzigen kritischen falschen Claim nicht automatisch kompensieren.

Verwandte Entitäten

WISSEN

Retrieval-Augmented Generation

RAG stellt externes Wissen als Kontext bereit. Groundedness bewertet anschließend, ob die Antwort dieses Wissen tatsächlich korrekt und nachvollziehbar verwendet.

Wissensbeitrag öffnen
WISSEN

ItemRAG

Bei ItemRAG kann Grounding auf strukturierte Produktattribute, Relationen, Varianten und einzelne Datenquellen heruntergebrochen werden.

Wissensbeitrag öffnen
WISSEN

Product Attribute Coverage

Fehlende oder unbelegte Produktattribute begrenzen, welche produktbezogenen Claims überhaupt grounded erzeugt werden können.

Wissensbeitrag öffnen
WISSEN

E-E-A-T

Groundedness beantwortet, ob eine Quelle einen Claim stützt. E-E-A-T und verwandte Qualitätskonzepte adressieren zusätzlich, wie vertrauenswürdig beziehungsweise geeignet die Quelle ist.

Wissensbeitrag öffnen
WISSEN

GEO-KPIs

Citation Frequency sollte um Citation-Evidence-Qualität ergänzt werden: Wird eine Quelle nur genannt oder stützt sie den entsprechenden Claim?

Wissensbeitrag öffnen
WISSEN

Large Language Models

Der Grundlagenbeitrag erklärt, warum autoregressive Sprachmodelle plausible Tokenfolgen generieren können, ohne dadurch automatisch faktische oder evidenzgestützte Antworten zu garantieren.

Wissensbeitrag öffnen

FAQ

Häufige Fragen zu Groundedness & Faithfulness

Was ist Groundedness bei einem LLM?

Groundedness beschreibt, ob Aussagen einer generierten Antwort auf konkrete Evidenz im bereitgestellten Kontext oder in definierten Quellen zurückgeführt werden können.

Was ist Faithfulness?

Faithfulness beschreibt, ob eine generierte Antwort ihrer Informationsgrundlage treu bleibt und keine nicht gestützten, widersprechenden oder übermäßig verallgemeinerten Claims ergänzt.

Sind Groundedness und Faithfulness dasselbe?

Die Begriffe werden in Forschung und Praxis teilweise überlappend verwendet. Für eine belastbare Evaluation sollte deshalb immer explizit definiert werden, welche Claim-Evidence-Beziehung die jeweilige Metrik misst.

Kann eine Antwort grounded und trotzdem falsch sein?

Ja. Wenn die bereitgestellte Quelle selbst falsch oder veraltet ist, kann die Antwort diese Quelle korrekt wiedergeben und dennoch faktisch falsch sein.

Kann eine richtige Antwort ungrounded sein?

Ja. Ein Modell kann einen korrekten Fakt aus seinem Parameterwissen erzeugen, obwohl dieser Fakt nicht im bereitgestellten Kontext enthalten ist. In einer strikt source-grounded Anwendung wäre diese Aussage trotzdem nicht ausreichend belegt.

Reicht eine Citation aus, um Groundedness zu beweisen?

Nein. Die Citation muss den konkreten Claim tatsächlich unterstützen. Eine bloße Quellenangabe ohne passende Evidenz ist kein belastbares Grounding.

Wie sollte Groundedness bei langen Antworten gemessen werden?

Sinnvoll ist eine Zerlegung in einzelne überprüfbare Claims. Anschließend kann für jeden Claim separat bewertet werden, ob die relevante Evidenz ihn unterstützt, ihm widerspricht oder keine ausreichende Information enthält.

Was ist der Unterschied zu Halluzinationen?

Halluzination ist ein breiterer Begriff für generierte Inhalte, die nicht ausreichend durch verlässliche Information gestützt sind. Groundedness und Faithfulness operationalisieren konkrete Teile dieses Problems für source- oder context-basierte Systeme.

Quellen

Wissenschaftliche Arbeiten zu Faithfulness, Factual Consistency und RAG Evaluation

Die Auswahl verbindet Grundlagenarbeiten zur factual consistency mit neueren Evaluationsframeworks für Retrieval-Augmented Generation. Die jeweiligen Metriken verwenden teilweise unterschiedliche Definitionen und sollten deshalb anhand ihrer konkreten Bewertungslogik verglichen werden.

Quelle Autoren / Jahr Einordnung Originalquelle
Faithfulness in Natural Language Generation: A Systematic Survey of Analysis, Evaluation and Optimization Methods Wei Li, Wenhao Wu, Moye Chen, Jiachen Liu, Xinyan Xiao & Hua Wu · 2022 Systematisiert das Faithfulness-Problem in Natural Language Generation und ordnet Analyse-, Evaluations- und Optimierungsmethoden über verschiedene Generierungsaufgaben hinweg ein. arXiv:2203.05227
QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization Alexander R. Fabbri, Chien-Sheng Wu, Wenhao Liu & Caiming Xiong · 2022 Untersucht QA-basierte factual-consistency-Metriken und zeigt, dass Fragen- und Antwortvergleich ein leistungsfähiger Ansatz zur Prüfung der Übereinstimmung von generiertem Text und Quelle sein kann. ACL Anthology
AlignScore: Evaluating Factual Consistency with a Unified Alignment Function Yuheng Zha, Yichi Yang, Ruichen Li & Zhiting Hu · 2023 Formuliert factual consistency als allgemeines Alignment-Problem zwischen zwei Texten und kombiniert Trainingssignale aus mehreren Aufgaben wie NLI, QA, Fact Verification und Summarization. ACL Anthology
FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation Sewon Min et al. · 2023 Zerlegt lange Generationen in atomare Fakten und bewertet, welcher Anteil dieser Fakten durch eine verlässliche Wissensquelle gestützt werden kann. ACL Anthology
SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models Potsawee Manakul, Adian Liusie & Mark Gales · 2023 Nutzt die Konsistenz mehrerer stochastisch erzeugter Antworten, um potenziell nicht-faktische Aussagen auch ohne externe Wissensdatenbank zu erkennen. ACL Anthology
RAGAs: Automated Evaluation of Retrieval Augmented Generation Shahul Es, Jithin James, Luis Espinosa Anke & Steven Schockaert · 2024 Bewertet RAG-Pipelines entlang mehrerer getrennten Dimensionen, insbesondere Retrieval-Kontext und faithful Nutzung dieses Kontextes durch die generierte Antwort. ACL Anthology
ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems Jon Saad-Falcon, Omar Khattab, Christopher Potts & Matei Zaharia · 2024 Entwickelt eine automatisierte RAG-Evaluation für Context Relevance, Answer Faithfulness und Answer Relevance und kombiniert Modell-Judges mit einer kleinen Menge menschlicher Annotationen. ACL Anthology

Wissen

Gute LLM-Antworten sollten nicht nur plausibel sein, sondern auf nachvollziehbarer Evidenz beruhen

Groundedness macht aus einer sprachlich überzeugenden Antwort eine überprüfbare Informationskette. Entscheidend ist, welche Aussage durch welche Evidenz gestützt wird, unter welchen Bedingungen sie gilt und wie zuverlässig die zugrunde liegende Quelle ist.