Wissen

Large Language Models

Moderne Large Language Models sind das Ergebnis mehrerer Entwicklungslinien: neuronale Sprachmodellierung, verteilte Repräsentationen, Attention, Transformer-Architekturen, generatives Pretraining, Skalierung, Post-Training und effizientere Inferenz. Der Kern moderner GPT-artiger Modelle ist dabei erstaunlich stabil geblieben: Tokens werden in Vektoren übersetzt, durch viele Transformer-Blöcke verarbeitet und anschließend wird wiederholt das nächste Token vorhergesagt.

  • Entity Class: Wissen
  • Content-Typ: Grundlagenbeitrag
  • Hauptthema: Large Language Models
  • Bereich: Generative AI / Transformer
LLM-Kern

Tokenisierung → Embeddings → Transformer-Blöcke → Wahrscheinlichkeiten für das nächste Token.

GPT

Generative · Pre-trained · Transformer: autoregressive Generierung, großskaliges Vortraining und Transformer-Architektur.

Fortschritt

Nicht nur mehr Parameter: Datenmenge und -qualität, Training, Post-Training, Attention, Inferenz und Test-Time Compute wurden verbessert.

Dokument-Metadaten

Worum geht es in diesem Wissensbeitrag?

Einordnung

Entity Class
Wissen
Content-Typ
Technischer Grundlagen- und Historienbeitrag
Hauptthema
Large Language Models und Generative Pre-trained Transformers
Zeitraum
Grundlagen vor dem Transformer bis zum aktuellen LLM-Paradigma
Fokus
Architektur, Training, Skalierung, Post-Training, Reasoning, Effizienz, Kontext und Multimodalität
Nicht Bestandteil des Kernmodells
RAG, externe Tools, Vektordatenbanken, Agent-Frameworks und Langzeit-Memory sind mögliche Systemerweiterungen, aber nicht automatisch Bestandteil des neuronalen LLM selbst.
Kernfrage
Aus welchen Komponenten besteht ein modernes LLM und welche wissenschaftlichen Fortschritte führten vom frühen neuronalen Sprachmodell zu heutigen GPT-artigen Systemen?

Definition

Was ist ein Large Language Model?

Ein Large Language Model ist ein neuronales Modell, das statistische Strukturen in großen Mengen sprachlicher oder multimodaler Trainingsdaten lernt. Bei einem autoregressiven generativen LLM besteht die zentrale Trainingsaufgabe darin, aus einer bisherigen Tokensequenz eine Wahrscheinlichkeitsverteilung für das nächste Token zu berechnen.

GPT als Begriffsstruktur

Generative
Das Modell erzeugt neue Tokensequenzen, indem es schrittweise Tokens aus einer vorhergesagten Verteilung auswählt.
Pre-trained
Vor einer konkreten Anwendung wird das Modell auf sehr großen allgemeinen Datenmengen mit einer selbstüberwachten Lernaufgabe trainiert.
Transformer
Die neuronale Architektur verarbeitet Tokenrepräsentationen primär über Attention, Feed-Forward-Netze, Residualpfade und Normalisierung.
Large
„Large“ beschreibt keine feste Parametergrenze. Gemeint sind Modelle, deren Größe, Datenmenge und Rechenaufwand weit über klassische aufgabenspezifische Sprachmodelle hinausgehen.
Knowledge
Wissen wird nicht wie in einer relationalen Datenbank als explizite Tabelle gespeichert, sondern ist verteilt in den trainierten Modellparametern repräsentiert.

Architektur

Vom Text zum nächsten Token.

Ein decoder-basiertes GPT-Modell verarbeitet keine Wörter im klassischen Sinn. Der Text wird zunächst in Tokens zerlegt und anschließend als Folge hochdimensionaler Vektoren durch wiederholte Transformer-Blöcke geschickt.

01 Input

Text, Code oder multimodale Repräsentation.

02 Tokenizer

Eingabe wird in Token-IDs zerlegt.

03 Embedding

Token-IDs werden zu lernbaren Vektoren.

04 Position

Reihenfolge bzw. relative Position wird repräsentiert.

05 Transformer × N

Attention und MLP verarbeiten Kontext über viele Schichten.

06 Logits

Scores für mögliche nächste Tokens.

07 Softmax

Scores werden zu Wahrscheinlichkeiten.

08 Decode

Token wählen und Prozess wiederholen.

Bestandteile

Die zentralen Komponenten eines modernen decoder-basierten LLM.

TOKENIZER

Text wird in diskrete Einheiten zerlegt

Moderne Modelle verwenden meist Subword- oder Byte-nahe Tokenisierung. Dadurch kann ein begrenztes Vokabular sehr viele Wörter, Wortteile, Zahlen und Code repräsentieren.

TOKEN EMBEDDINGS

Token-IDs werden zu Vektoren

Eine lernbare Matrix ordnet jedem Token einen hochdimensionalen Vektor zu. Erst diese kontinuierlichen Repräsentationen können von neuronalen Schichten verarbeitet werden.

POSITION

Die Reihenfolge muss sichtbar werden

Attention enthält keine natürliche Sequenzreihenfolge. Moderne Modelle integrieren deshalb Positionsinformation, häufig über relative oder rotierende Verfahren wie RoPE.

SELF-ATTENTION

Tokens beziehen sich auf relevanten Kontext

Für jedes Token werden Query-, Key- und Value-Repräsentationen erzeugt. Ihre Interaktion bestimmt, welche vorherigen Tokens den aktuellen Repräsentationsschritt stärker beeinflussen.

CAUSAL MASK

Die Zukunft bleibt verborgen

GPT-artige Decoder dürfen bei der Vorhersage eines Tokens nur vorherige Positionen berücksichtigen. Das entspricht dem späteren autoregressiven Generierungsprozess.

MLP / FFN

Nichtlineare Transformation pro Token

Nach der Attention verarbeitet ein Feed-Forward-Netz jede Tokenrepräsentation. Moderne Varianten nutzen häufig gated Aktivierungen wie SwiGLU.

NORMALIZATION

Training tiefer Netze stabilisieren

LayerNorm beziehungsweise RMSNorm stabilisieren Aktivierungen. Viele moderne LLMs verwenden Pre-Norm-Strukturen und RMSNorm.

RESIDUAL CONNECTIONS

Information durch viele Schichten transportieren

Residualpfade addieren die Eingabe eines Teilblocks wieder zu dessen Ausgabe und erleichtern Optimierung und Informationsfluss.

OUTPUT HEAD

Vom Hidden State zum Vokabular

Die finale Repräsentation wird auf Scores über das Tokenvokabular projiziert. Daraus entsteht die Verteilung für das nächste Token.

PARAMETER

Gelernte Gewichte

Parameter sind die numerischen Gewichte von Embeddings, Attention-Projektionen, MLPs und weiteren Modellteilen und werden während des Trainings angepasst.

CONTEXT WINDOW

Aktiver Arbeitskontext

Das Kontextfenster begrenzt, wie viele Tokens eine Anfrage gleichzeitig berücksichtigen kann. Ein großes Fenster ist nicht identisch mit perfekter Nutzung aller enthaltenen Informationen.

KV CACHE

Effizientere autoregressive Inferenz

Bereits berechnete Key- und Value-Repräsentationen früherer Tokens werden beim Generieren zwischengespeichert und müssen nicht vollständig neu berechnet werden.

Self-Attention

Warum Attention der zentrale Transformer-Mechanismus wurde

Vereinfachtes Q-K-V-Modell

Query
Welche Information sucht die aktuelle Tokenrepräsentation?
Key
Welche Art von Information kann eine andere Position anbieten?
Value
Welche Information wird übertragen, wenn eine Position relevant ist?
Attention Score
Ähnlichkeit von Query und Key bestimmt die relative Gewichtung.
Multi-Head Attention
Mehrere Attention-Heads können unterschiedliche relationale Muster parallel modellieren.
GQA / MQA
Spätere Varianten reduzieren die Zahl separater Key-/Value-Heads und können dadurch Inferenzspeicher und -kosten reduzieren.
Vereinfacht
Attention(Q,K,V) = softmax(QKᵀ / √d) · V

Training

Ein modernes Chat-LLM entsteht in mehreren Trainingsphasen.

01 Data

Große Mengen Text, Code und ggf. multimodaler Daten.

02 Pretraining

Selbstüberwachtes Lernen der nächsten Tokenverteilung.

03 Base Model

Breite statistische Sprach- und Wissensrepräsentation.

04 SFT

Supervised Fine-Tuning auf Instruktionen.

05 Preference

RLHF, DPO oder verwandte Verfahren.

06 Reasoning / Safety

Spezialisierte Post-Training-Schritte.

07 Inference

Prompt, Kontext, Decoding und Test-Time Compute.

Pretraining Objective

Next-Token Prediction wirkt einfach – skaliert aber auf viele Fähigkeiten.

Autoregressives Sprachmodell

Eingabe
Tokenfolge x₁ … xₜ
Ziel
Wahrscheinlichkeit des nächsten Tokens xₜ₊₁ maximieren
Loss
Typischerweise Cross-Entropy zwischen vorhergesagter und tatsächlicher Next-Token-Verteilung
Self-Supervision
Der Text selbst liefert die Zieltokens; es müssen nicht für jeden Trainingsschritt manuelle Labels erstellt werden.
Erlernte Muster
Syntax, Stil, Faktenkorrelationen, Code-Strukturen, Aufgabenformate und viele weitere statistische Regularitäten können aus der Vorhersageaufgabe entstehen.
Grenze
Next-Token Prediction garantiert weder Wahrheit noch Zielausrichtung. Genau deshalb wurden Post-Training und Alignment zu zentralen Entwicklungslinien.

Transformer-Familien

Nicht jeder Transformer ist ein GPT.

ENCODER-ONLY

BERT-artige Modelle

Bidirektionale Encoder verarbeiten den gesamten Eingabetext und eignen sich besonders für Repräsentations- und Verständnisaufgaben. BERT ist ein wichtiger Pretraining-Meilenstein, aber kein autoregressives GPT.

DECODER-ONLY

GPT-artige Modelle

Causal Decoder modellieren die nächste Tokenwahrscheinlichkeit. Diese Architektur wurde zum dominierenden Grundmuster moderner generativer Text- und Chat-LLMs.

ENCODER-DECODER

T5-artige Modelle

Ein Encoder verarbeitet die Eingabe, ein separater Decoder erzeugt die Ausgabe. Diese Architektur bleibt für Sequenz-zu-Sequenz-Aufgaben relevant.

Historische Entwicklung

Vom neuronalen Sprachmodell zum modernen generativen LLM.

2003 · Neuronale Sprachmodelle

Paper / Quelle
Bengio et al. – A Neural Probabilistic Language Model
Meilenstein
Wörter werden als gelernte kontinuierliche Vektoren repräsentiert; eine neuronale Funktion modelliert Wortfolgenwahrscheinlichkeiten.
Bedeutung
Verteilte Repräsentationen und neuronale Sprachmodellierung bilden eine direkte Grundlage späterer LLMs.

2014 · Attention

Paper / Quelle
Bahdanau, Cho & Bengio – Neural Machine Translation by Jointly Learning to Align and Translate
Meilenstein
Der Decoder kann bei jedem Ausgabeschritt unterschiedliche Teile der Eingabesequenz gewichten.
Bedeutung
Attention beseitigt den festen Encoder-Vektor als alleinigen Informationsengpass.

2015/2016 · Subword-Tokenisierung

Paper / Quelle
Sennrich, Haddow & Birch – Neural Machine Translation of Rare Words with Subword Units
Meilenstein
Seltene und unbekannte Wörter werden aus kleineren Subword-Einheiten zusammengesetzt.
Bedeutung
BPE-artige Verfahren werden zum wichtigen Baustein moderner Tokenizer.

2017 · Transformer

Paper / Quelle
Vaswani et al. – Attention Is All You Need
Meilenstein
Sequenzverarbeitung wird ohne rekurrente oder convolutionale Hauptstruktur durch Attention-basierte Blöcke umgesetzt.
Bedeutung
Die Grundarchitektur späterer GPT-Modelle entsteht.

2018 · GPT-1

Paper / Quelle
Radford et al. – Improving Language Understanding by Generative Pre-Training
Meilenstein
Generatives Transformer-Pretraining auf unbeschriftetem Text plus Fine-Tuning wird als Transfer-Learning-Verfahren etabliert.
Bedeutung
Die namensgebende GPT-Kombination wird sichtbar.

2018 · BERT

Paper / Quelle
Devlin et al. – BERT
Meilenstein
Bidirektionales Transformer-Pretraining mit Masked Language Modeling erzielt starke Understanding-Ergebnisse.
Bedeutung
Zeigt, dass Transformer-Pretraining ein allgemeines NLP-Paradigma mit mehreren Architekturzweigen ist.

2019 · GPT-2

Paper / Quelle
Radford et al. – Language Models are Unsupervised Multitask Learners
Meilenstein
Größeres autoregressives Pretraining zeigt zunehmend Zero-Shot-Aufgabenverhalten.
Bedeutung
Aufgaben können stärker über natürlichen Kontext statt separates Fine-Tuning spezifiziert werden.

2020 · Scaling Laws

Paper / Quelle
Kaplan et al. – Scaling Laws for Neural Language Models
Meilenstein
Loss zeigt systematische Power-Law-Beziehungen zu Modellgröße, Datenmenge und Compute.
Bedeutung
Skalierung wird planbarer und quantifizierbarer.

2020 · GPT-3

Paper / Quelle
Brown et al. – Language Models are Few-Shot Learners
Meilenstein
Instruktionen und Beispiele im Prompt reichen für viele neue Aufgaben ohne Gradientenupdate.
Bedeutung
In-Context Learning und Prompting werden zentrale Nutzungsmuster.

2020–2021 · Moderner Block

Paper / Quelle
RMSNorm, SwiGLU, RoPE und Switch Transformer
Meilenstein
Normalisierung, MLP, Position und Sparsity werden gegenüber dem Original-Transformer weiterentwickelt.
Bedeutung
Viele heute verbreitete LLM-Bausteine entstehen in dieser Phase.

2022 · Chinchilla

Paper / Quelle
Hoffmann et al. – Training Compute-Optimal Large Language Models
Meilenstein
Unter festem Compute-Budget sollten Modellgröße und Trainingsdaten gemeinsam skaliert werden.
Bedeutung
Mehr Parameter allein ist kein compute-optimales Rezept.

2022 · Chain-of-Thought

Paper / Quelle
Wei et al. – Chain-of-Thought Prompting
Meilenstein
Zwischenschritt-Demonstrationen im Prompt verbessern komplexe Reasoning-Aufgaben großer Modelle.
Bedeutung
Reasoning wird als eigener Prompt-, Decoding- und später Post-Training-Bereich sichtbar.

2022 · InstructGPT

Paper / Quelle
Ouyang et al. – Training language models to follow instructions with human feedback
Meilenstein
Supervised Demonstrationen, Präferenzdaten und RLHF verbessern das Befolgen von Nutzerintentionen.
Bedeutung
Post-Training wird neben Pretraining zur zweiten entscheidenden Modellphase.

2022 · FlashAttention

Paper / Quelle
Dao et al. – FlashAttention
Meilenstein
Exakte Attention wird IO-aware implementiert und reduziert Speichertransfers.
Bedeutung
Hardware- und Kernel-Effizienz werden zu eigenständigen Fortschrittshebeln.

2023 · LLaMA

Paper / Quelle
Touvron et al. – LLaMA
Meilenstein
Relativ kleinere, intensiv auf vielen Tokens trainierte Foundation Models erreichen sehr starke Leistung.
Bedeutung
Effiziente Trainingsrezepte und offene Modellfamilien beschleunigen das Ökosystem.

2023 · GPT-4

Paper / Quelle
GPT-4 Technical Report
Meilenstein
Text- und Bildeingaben werden in einem großen Transformer-basierten Modell kombiniert.
Bedeutung
Multimodalität wird zum Frontier-Merkmal.

2023 · DPO

Paper / Quelle
Rafailov et al. – Direct Preference Optimization
Meilenstein
Präferenzdaten können direkt zur Optimierung des Sprachmodells verwendet werden.
Bedeutung
Preference Optimization wird methodisch einfacher und breiter.

2023 · GQA

Paper / Quelle
Ainslie et al. – Grouped-Query Attention
Meilenstein
Weniger Key-/Value-Heads reduzieren Speicher- und Inferenzkosten bei ähnlicher Qualität.
Bedeutung
KV-Cache und Speicherbandbreite werden zentrale Decoder-Optimierungsziele.

2024 · Long Context

Paper / Quelle
Gemini 1.5 Technical Report
Meilenstein
Sehr große multimodale Kontextfenster werden für lange Dokumente, Video und Audio demonstriert.
Bedeutung
Kontextlänge wird zu einer eigenen Skalierungsdimension.

2024 · Test-Time Compute

Paper / Quelle
Snell et al. – Scaling LLM Test-Time Compute Optimally
Meilenstein
Zusätzlicher Inferenzcompute kann auf geeigneten schwierigen Aufgaben effizienter sein als ausschließlich größere Modelle.
Bedeutung
Inference-Time Scaling wird zu einer neuen Leistungsachse.

2025 · Reasoning RL

Paper / Quelle
DeepSeek-R1
Meilenstein
Reinforcement Learning auf verifizierbaren Aufgaben kann komplexere Reasoning-Strategien fördern.
Bedeutung
Reasoning-orientiertes Post-Training wird zu einer zentralen Frontier-Linie.

2025–heute · Hybridisierung

Paper / Quelle
Qwen3 Technical Report und aktuelle Modellfamilien
Meilenstein
Dense- und MoE-Architekturen, mehrsprachige Daten, Long Context und Thinking Modes koexistieren.
Bedeutung
Fortschritt entsteht aus Architektur, Daten, Post-Training, Kontext und Inferenzcompute als Gesamtsystem.

Fortschrittsdimensionen

Was wurde seit dem ursprünglichen Transformer eigentlich verbessert?

Scale

Mehr Parameter und Compute erhöhten Kapazität, waren aber nie die einzige Variable.

Training Data

Mehr Tokens, bessere Datenmischungen, Deduplication und Qualitätsfilter verbesserten Generalisierung.

Architecture

RoPE, RMSNorm, SwiGLU, GQA und MoE veränderten einzelne Bausteine.

Training Efficiency

Scaling Laws und Chinchilla-artige Compute-Optimierung verbesserten die Allokation zwischen Parametern und Daten.

Systems

FlashAttention, Parallelisierung, niedrigere Präzision und optimierte Kernels senkten reale Kosten.

Post-Training

Instruction Tuning, RLHF, DPO und Reasoning-RL machten aus Base Models besser steuerbare Assistenten.

Context

Größere Fenster und Context-Management-Techniken erweiterten Langzeitaufgaben.

Inference Compute

Reasoning und Test-Time Scaling erlauben dynamisch mehr Rechenaufwand für schwierige Anfragen.

Moderner Transformer-Block

Ein heutiger GPT-Block ist dem Original ähnlich – aber nicht identisch.

Typische moderne Varianten

Normalization
Häufig Pre-Norm und RMSNorm statt ausschließlich ursprünglicher Post-LayerNorm-Strukturen.
Position
RoPE oder verwandte relative Positionsverfahren statt rein sinusförmiger additiver Positionskodierung.
Attention
Multi-Head, Grouped-Query, Multi-Query oder andere Varianten zur Balance aus Qualität und Inferenzkosten.
MLP
Gated Feed-Forward-Netze wie SwiGLU statt einfacher ReLU-Strukturen.
Sparsity
Bei MoE-Modellen werden pro Token nur ausgewählte Expert-Netze aktiviert.
Implementation
FlashAttention und optimierte Kernels verändern nicht zwingend die Mathematik des Modells, aber die praktische Effizienz.

Post-Training

Warum ein Base Model noch kein guter Chat-Assistent ist.

BASE MODEL

Next-Token-Kompetenz

Das vortrainierte Modell setzt Textwahrscheinlichkeiten fort, besitzt aber keine Garantie, Anweisungen konsistent oder hilfreich zu befolgen.

SFT

Instruction Demonstrations

Supervised Fine-Tuning zeigt gewünschte Prompt-Antwort-Muster und Aufgabenformate.

RLHF

Menschliche Präferenzen

Bewertungen alternativer Antworten werden zu einem Trainingssignal für gewünschteres Verhalten.

DPO

Direkte Preference Optimization

Präferenzpaare können direkt zur Optimierung des Sprachmodells verwendet werden.

REASONING RL

Verifizierbare Aufgaben

Bei Mathematik, Code und anderen verifizierbaren Domänen kann RL stärker an objektiv prüfbare Ergebnisse gekoppelt werden.

SAFETY

Verhaltensgrenzen

Zusätzliche Daten, Evaluations- und Trainingsverfahren sollen riskantes oder unerwünschtes Verhalten reduzieren.

Inference

Auch nach dem Training beeinflusst die Laufzeit das Ergebnis.

Wichtige Inferenzfaktoren

Prompt
Instruktionen, Beispiele und Kontext konditionieren die Tokenverteilung.
Temperature
Steuert, wie stark die Wahrscheinlichkeitsverteilung abgeflacht oder konzentriert wird.
Top-p / Top-k
Beschränken die Auswahlmenge möglicher Tokens beim Sampling.
KV Cache
Speichert Attention-Zwischenergebnisse vorheriger Tokens für effizientere Generation.
Test-Time Compute
Ein System kann bei komplexen Aufgaben mehr Such-, Prüf- oder Reasoning-Schritte verwenden.
Tools / RAG
Externe Suche, Datenbanken oder Tools können zusätzliche Informationen liefern; sie erweitern das LLM-System, sind aber nicht identisch mit dem Basismodell.

Scaling

„Größer“ wurde schrittweise durch „compute-optimal“ ergänzt.

Parameters

Bestimmen einen Teil der Modellkapazität und Inferenzkosten.

Training Tokens

Ein großes Modell benötigt ausreichend Trainingsdaten, um seine Kapazität sinnvoll auszunutzen.

Data Quality

Die Zusammensetzung der Trainingsdaten kann ebenso wichtig sein wie ihre reine Menge.

Training FLOPs

Compute-Budget verbindet Modellgröße, Datenmenge und Optimierung.

Active Parameters

MoE-Modelle können deutlich mehr Gesamtparameter als pro Token aktivierte Parameter besitzen.

Inference FLOPs

Reasoning-orientierte Systeme können Leistung zusätzlich über Rechenaufwand zur Laufzeit skalieren.

Systemgrenze

Was gehört zum LLM – und was gehört zum System um das LLM?

IM MODELL

Parameter und neuronale Architektur

Tokenizer-Konfiguration, Embeddings, Transformer-Blöcke, Normalisierung, Attention, MLP und Output Head bilden den Kern des Modells.

KONTEXT

Temporäre Laufzeitinformation

Systemprompt, Nutzerchat, Tool-Ergebnisse und Dokumente können in das Context Window gegeben werden, ohne Teil der trainierten Parameter zu werden.

RAG

Externer Wissenszugriff

Retrieval-Systeme wählen zusätzliche Informationen aus externen Wissensquellen aus und ergänzen den Modellkontext.

RAG öffnen
TOOLS

Aktionen und externe Berechnungen

Browser, Code-Interpreter, APIs oder Datenbanken können von einem Modell orchestriert werden, sind aber separate Komponenten.

MEMORY

Persistenter Kontext außerhalb des Modells

Memory-Systeme speichern Informationen über einzelne Context Windows hinweg.

AGENT

LLM plus Steuerlogik

Ein Agent kombiniert das Modell häufig mit Tools, Memory, Planung, Retrieval und Schleifen für mehrstufige Aufgaben.

Grenzen

Technischer Fortschritt löst nicht automatisch alle Grundprobleme.

Persistente Herausforderungen

Halluzinationen
Wahrscheinliche sprachliche Fortsetzungen sind nicht automatisch faktisch korrekt.
Knowledge Freshness
Parameterwissen wird nicht automatisch mit aktuellen Ereignissen synchronisiert.
Context Limits
Auch sehr große Kontextfenster haben Kapazitäts-, Kosten- und Nutzungsgrenzen.
Reasoning Reliability
Mehr Reasoning-Compute kann Leistung steigern, garantiert aber keine Fehlerfreiheit.
Data Bias
Trainingsdaten beeinflussen Sprache, Wissen, Lücken und Verzerrungen des Modells.
Evaluation
Benchmark-Leistung ist nicht identisch mit zuverlässigem Verhalten in offenen realen Aufgaben.
Interpretability
Die interne Repräsentation komplexen Wissens in Milliarden Parametern ist nur begrenzt direkt interpretierbar.

Verwandte Entitäten

WISSEN

Retrieval-Augmented Generation

Erklärt, wie externe Wissensquellen zur Laufzeit in den Kontext eines generativen Modells eingebunden werden.

Wissensbeitrag öffnen
WISSEN

Context Folding

Behandelt die aktive Verdichtung wachsender Arbeitskontexte in langen LLM- und Agenten-Workflows.

Wissensbeitrag öffnen
WISSEN

ItemRAG

Überträgt Retrieval-Augmented Generation auf strukturierte Produktobjekte, Attribute und Relationen.

Wissensbeitrag öffnen
WISSEN

E-E-A-T

Ordnet Experience, Expertise, Authoritativeness und Trustworthiness als Qualitäts- und Vertrauenskonzept ein.

Wissensbeitrag öffnen

FAQ

Häufige Fragen zu Large Language Models und GPT.

Wofür steht GPT?

GPT steht für Generative Pre-trained Transformer: ein generatives Modell, das zunächst großflächig vortrainiert wird und auf einer Transformer-Architektur basiert.

Ist jedes LLM ein Transformer?

Nein. „Large Language Model“ beschreibt keine einzelne Architektur. Die heute dominierenden generativen LLMs sind jedoch überwiegend Transformer-basiert.

Was ist der wichtigste Bestandteil eines GPT-Modells?

Es gibt keinen einzelnen Baustein, der allein das Modell erklärt. Der zentrale Architekturmechanismus ist Self-Attention innerhalb wiederholter Transformer-Blöcke; ebenso notwendig sind Tokenisierung, Embeddings, Positionsinformation, MLPs, Normalisierung und Output Head.

Speichert ein LLM Wissen wie eine Datenbank?

Nein. Das während des Trainings gelernte Wissen ist verteilt in den Modellgewichten repräsentiert. Einzelne Fakten lassen sich nicht so direkt adressieren oder aktualisieren wie Zeilen einer klassischen Datenbank.

Warum wurde GPT-3 historisch wichtig?

GPT-3 zeigte besonders deutlich, dass ein ausreichend großes autoregressives Sprachmodell viele Aufgaben allein über Instruktionen und Beispiele im Prompt ausführen kann, ohne für jede Aufgabe neu feinabgestimmt zu werden.

Warum ist Chinchilla ein wichtiger Meilenstein?

Die Arbeit zeigte, dass unter einem gegebenen Trainingscompute nicht einfach nur die Parameterzahl maximiert werden sollte. Modellgröße und Menge der Trainingsdaten müssen gemeinsam sinnvoll skaliert werden.

Was änderte RLHF an LLMs?

RLHF adressiert primär das Verhalten gegenüber Nutzerintentionen. Präferenzdaten werden genutzt, um hilfreichere und besser steuerbare Antworten zu fördern.

Sind Reasoning-Modelle eine völlig neue Architektur?

Nicht zwingend. Ein großer Teil des aktuellen Reasoning-Fortschritts entsteht durch Post-Training, Reinforcement Learning, Verifier, Sampling und zusätzlichen Test-Time Compute auf weiterhin Transformer-basierten Grundmodellen.

Gehören RAG und Tools zum LLM?

Sie können Teil eines LLM-basierten Systems sein, sind aber normalerweise externe Komponenten. Das LLM selbst ist das trainierte neuronale Modell; Retrieval, APIs, Browser, Memory und Agentenlogik liegen darum herum.

Quellen

Wissenschaftliche Meilensteine der LLM- und GPT-Entwicklung.

Die Auswahl konzentriert sich auf Arbeiten, die zentrale Architektur-, Trainings-, Skalierungs- und Inferenzmeilensteine der Entwicklung moderner Large Language Models markieren.

Jahr / Quelle Arbeit Maßgebliche Erkenntnis Originalquelle
2003 · JMLR A Neural Probabilistic Language Model Yoshua Bengio et al. Neuronale Wahrscheinlichkeitsmodelle lernen verteilte Wortrepräsentationen und bilden eine frühe Grundlage neuronaler Sprachmodellierung. JMLR
2014 · ICLR Neural Machine Translation by Jointly Learning to Align and Translate Dzmitry Bahdanau, Kyunghyun Cho & Yoshua Bengio Attention erlaubt eine dynamische Gewichtung relevanter Eingabepositionen. arXiv:1409.0473
2015/2016 · ACL Neural Machine Translation of Rare Words with Subword Units Rico Sennrich, Barry Haddow & Alexandra Birch Subword-Segmentierung mit BPE macht offene Vokabulare praktikabler. arXiv:1508.07909
2017 · NeurIPS Attention Is All You Need Ashish Vaswani et al. Begründet die Transformer-Architektur als vollständig Attention-basiertes Sequenzmodell. arXiv:1706.03762
2018 · OpenAI Improving Language Understanding by Generative Pre-Training Alec Radford et al. Generatives Transformer-Pretraining plus Fine-Tuning etabliert das GPT-Transfer-Learning-Muster. OpenAI Paper
2018/2019 · NAACL BERT Jacob Devlin et al. Bidirektionales Transformer-Pretraining zeigt die Breite des Pretraining-Paradigmas. arXiv:1810.04805
2019 · OpenAI Language Models are Unsupervised Multitask Learners Alec Radford et al. GPT-2 zeigt zunehmendes Zero-Shot-Aufgabenverhalten mit großem generativem Pretraining. OpenAI Paper
2019 · NeurIPS Root Mean Square Layer Normalization Biao Zhang & Rico Sennrich RMSNorm vereinfacht Normalisierung und wird später verbreitet in LLMs eingesetzt. arXiv:1910.07467
2020 · arXiv Scaling Laws for Neural Language Models Jared Kaplan et al. Beschreibt systematische Skalierungsbeziehungen zu Modellgröße, Daten und Compute. arXiv:2001.08361
2020 · NeurIPS Language Models are Few-Shot Learners Tom B. Brown et al. GPT-3 etabliert Few-Shot und In-Context Learning als zentrales Nutzungsmuster. arXiv:2005.14165
2020 · arXiv GLU Variants Improve Transformer Noam Shazeer Gated Feed-Forward-Varianten wie SwiGLU verbessern Transformer-MLPs. arXiv:2002.05202
2021/2022 · JMLR Switch Transformers William Fedus, Barret Zoph & Noam Shazeer Sparse Mixture-of-Experts kombiniert viele Gesamtparameter mit sparsamer Aktivierung. arXiv:2101.03961
2021 · RoFormer RoFormer: Enhanced Transformer with Rotary Position Embedding Jianlin Su et al. RoPE integriert Positionsinformation in die Attention-Geometrie. arXiv:2104.09864
2022 · DeepMind Training Compute-Optimal Large Language Models Jordan Hoffmann et al. Chinchilla verschiebt den Fokus von reiner Parametergröße zu compute-optimaler Balance aus Modell und Daten. arXiv:2203.15556
2022/2023 · NeurIPS Chain-of-Thought Prompting Elicits Reasoning in Large Language Models Jason Wei et al. Zwischenschritt-Demonstrationen können komplexes Reasoning großer Modelle verbessern. arXiv:2201.11903
2022 · NeurIPS Training language models to follow instructions with human feedback Long Ouyang et al. Instruction Fine-Tuning plus RLHF macht aus Base Models besser steuerbare Assistenten. arXiv:2203.02155
2022 · NeurIPS FlashAttention Tri Dao et al. IO-aware exakte Attention reduziert Speichertransfers und beschleunigt Training und lange Sequenzen. arXiv:2205.14135
2023 · arXiv LLaMA: Open and Efficient Foundation Language Models Hugo Touvron et al. Effizient trainierte, zugänglichere Foundation Models beschleunigen das offene LLM-Ökosystem. arXiv:2302.13971
2023 · arXiv GPT-4 Technical Report OpenAI et al. Multimodale Eingaben und stark skaliertes Transformer-Pretraining markieren eine neue Frontier-Phase. arXiv:2303.08774
2023 · NeurIPS Direct Preference Optimization Rafael Rafailov et al. Präferenzlernen wird als direktes Optimierungsproblem für Sprachmodelle formuliert. arXiv:2305.18290
2023 · EMNLP GQA: Training Generalized Multi-Query Transformer Models Joshua Ainslie et al. Grouped-Query Attention verbessert den Trade-off zwischen Qualität, KV-Cache-Größe und Geschwindigkeit. ACL Anthology
2024 · Technical Report Gemini 1.5 Gemini Team Sehr lange multimodale Kontextfenster etablieren Kontextlänge als eigene Frontier-Dimension. arXiv:2403.05530
2024 · arXiv Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters Charlie Snell et al. Zusätzlicher Inferenzcompute wird als eigene Skalierungsachse untersucht. arXiv:2408.03314
2025 · Nature DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning DeepSeek-AI et al. Reasoning-orientiertes Reinforcement Learning wird zu einer zentralen Post-Training-Linie. Nature DOI
2025 · Technical Report Qwen3 Technical Report An Yang et al. Aktuelle Modellfamilien kombinieren dense und MoE-Modelle, Mehrsprachigkeit und reasoning-orientierte Betriebsmodi. arXiv:2505.09388

Wissen

Der moderne LLM-Fortschritt ist die Kombination vieler kleiner und großer Verbesserungen.

Der Transformer von 2017 ist weiterhin klar erkennbar. Seine heutige Leistungsfähigkeit entsteht jedoch aus Jahrzehnten neuronaler Sprachmodellierung und aus Fortschritten bei Tokenisierung, Daten, Skalierung, Attention, Normalisierung, sparsamer Aktivierung, Post-Training, Hardware-Nutzung, Kontext und zusätzlichem Inferenzcompute.