Wissen
Large Language Models
Moderne Large Language Models sind das Ergebnis mehrerer Entwicklungslinien: neuronale Sprachmodellierung, verteilte Repräsentationen, Attention, Transformer-Architekturen, generatives Pretraining, Skalierung, Post-Training und effizientere Inferenz. Der Kern moderner GPT-artiger Modelle ist dabei erstaunlich stabil geblieben: Tokens werden in Vektoren übersetzt, durch viele Transformer-Blöcke verarbeitet und anschließend wird wiederholt das nächste Token vorhergesagt.
Tokenisierung → Embeddings → Transformer-Blöcke → Wahrscheinlichkeiten für das nächste Token.
Generative · Pre-trained · Transformer: autoregressive Generierung, großskaliges Vortraining und Transformer-Architektur.
Nicht nur mehr Parameter: Datenmenge und -qualität, Training, Post-Training, Attention, Inferenz und Test-Time Compute wurden verbessert.
Dokument-Metadaten
Worum geht es in diesem Wissensbeitrag?
Einordnung
- Entity Class
- Wissen
- Content-Typ
- Technischer Grundlagen- und Historienbeitrag
- Hauptthema
- Large Language Models und Generative Pre-trained Transformers
- Zeitraum
- Grundlagen vor dem Transformer bis zum aktuellen LLM-Paradigma
- Fokus
- Architektur, Training, Skalierung, Post-Training, Reasoning, Effizienz, Kontext und Multimodalität
- Nicht Bestandteil des Kernmodells
- RAG, externe Tools, Vektordatenbanken, Agent-Frameworks und Langzeit-Memory sind mögliche Systemerweiterungen, aber nicht automatisch Bestandteil des neuronalen LLM selbst.
- Kernfrage
- Aus welchen Komponenten besteht ein modernes LLM und welche wissenschaftlichen Fortschritte führten vom frühen neuronalen Sprachmodell zu heutigen GPT-artigen Systemen?
Definition
Was ist ein Large Language Model?
Ein Large Language Model ist ein neuronales Modell, das statistische Strukturen in großen Mengen sprachlicher oder multimodaler Trainingsdaten lernt. Bei einem autoregressiven generativen LLM besteht die zentrale Trainingsaufgabe darin, aus einer bisherigen Tokensequenz eine Wahrscheinlichkeitsverteilung für das nächste Token zu berechnen.
GPT als Begriffsstruktur
- Generative
- Das Modell erzeugt neue Tokensequenzen, indem es schrittweise Tokens aus einer vorhergesagten Verteilung auswählt.
- Pre-trained
- Vor einer konkreten Anwendung wird das Modell auf sehr großen allgemeinen Datenmengen mit einer selbstüberwachten Lernaufgabe trainiert.
- Transformer
- Die neuronale Architektur verarbeitet Tokenrepräsentationen primär über Attention, Feed-Forward-Netze, Residualpfade und Normalisierung.
- Large
- „Large“ beschreibt keine feste Parametergrenze. Gemeint sind Modelle, deren Größe, Datenmenge und Rechenaufwand weit über klassische aufgabenspezifische Sprachmodelle hinausgehen.
- Knowledge
- Wissen wird nicht wie in einer relationalen Datenbank als explizite Tabelle gespeichert, sondern ist verteilt in den trainierten Modellparametern repräsentiert.
Architektur
Vom Text zum nächsten Token.
Ein decoder-basiertes GPT-Modell verarbeitet keine Wörter im klassischen Sinn. Der Text wird zunächst in Tokens zerlegt und anschließend als Folge hochdimensionaler Vektoren durch wiederholte Transformer-Blöcke geschickt.
Text, Code oder multimodale Repräsentation.
Eingabe wird in Token-IDs zerlegt.
Token-IDs werden zu lernbaren Vektoren.
Reihenfolge bzw. relative Position wird repräsentiert.
Attention und MLP verarbeiten Kontext über viele Schichten.
Scores für mögliche nächste Tokens.
Scores werden zu Wahrscheinlichkeiten.
Token wählen und Prozess wiederholen.
Bestandteile
Die zentralen Komponenten eines modernen decoder-basierten LLM.
Text wird in diskrete Einheiten zerlegt
Moderne Modelle verwenden meist Subword- oder Byte-nahe Tokenisierung. Dadurch kann ein begrenztes Vokabular sehr viele Wörter, Wortteile, Zahlen und Code repräsentieren.
Token-IDs werden zu Vektoren
Eine lernbare Matrix ordnet jedem Token einen hochdimensionalen Vektor zu. Erst diese kontinuierlichen Repräsentationen können von neuronalen Schichten verarbeitet werden.
Die Reihenfolge muss sichtbar werden
Attention enthält keine natürliche Sequenzreihenfolge. Moderne Modelle integrieren deshalb Positionsinformation, häufig über relative oder rotierende Verfahren wie RoPE.
Tokens beziehen sich auf relevanten Kontext
Für jedes Token werden Query-, Key- und Value-Repräsentationen erzeugt. Ihre Interaktion bestimmt, welche vorherigen Tokens den aktuellen Repräsentationsschritt stärker beeinflussen.
Die Zukunft bleibt verborgen
GPT-artige Decoder dürfen bei der Vorhersage eines Tokens nur vorherige Positionen berücksichtigen. Das entspricht dem späteren autoregressiven Generierungsprozess.
Nichtlineare Transformation pro Token
Nach der Attention verarbeitet ein Feed-Forward-Netz jede Tokenrepräsentation. Moderne Varianten nutzen häufig gated Aktivierungen wie SwiGLU.
Training tiefer Netze stabilisieren
LayerNorm beziehungsweise RMSNorm stabilisieren Aktivierungen. Viele moderne LLMs verwenden Pre-Norm-Strukturen und RMSNorm.
Information durch viele Schichten transportieren
Residualpfade addieren die Eingabe eines Teilblocks wieder zu dessen Ausgabe und erleichtern Optimierung und Informationsfluss.
Vom Hidden State zum Vokabular
Die finale Repräsentation wird auf Scores über das Tokenvokabular projiziert. Daraus entsteht die Verteilung für das nächste Token.
Gelernte Gewichte
Parameter sind die numerischen Gewichte von Embeddings, Attention-Projektionen, MLPs und weiteren Modellteilen und werden während des Trainings angepasst.
Aktiver Arbeitskontext
Das Kontextfenster begrenzt, wie viele Tokens eine Anfrage gleichzeitig berücksichtigen kann. Ein großes Fenster ist nicht identisch mit perfekter Nutzung aller enthaltenen Informationen.
Effizientere autoregressive Inferenz
Bereits berechnete Key- und Value-Repräsentationen früherer Tokens werden beim Generieren zwischengespeichert und müssen nicht vollständig neu berechnet werden.
Self-Attention
Warum Attention der zentrale Transformer-Mechanismus wurde
Vereinfachtes Q-K-V-Modell
- Query
- Welche Information sucht die aktuelle Tokenrepräsentation?
- Key
- Welche Art von Information kann eine andere Position anbieten?
- Value
- Welche Information wird übertragen, wenn eine Position relevant ist?
- Attention Score
- Ähnlichkeit von Query und Key bestimmt die relative Gewichtung.
- Multi-Head Attention
- Mehrere Attention-Heads können unterschiedliche relationale Muster parallel modellieren.
- GQA / MQA
- Spätere Varianten reduzieren die Zahl separater Key-/Value-Heads und können dadurch Inferenzspeicher und -kosten reduzieren.
Attention(Q,K,V) = softmax(QKᵀ / √d) · V
Training
Ein modernes Chat-LLM entsteht in mehreren Trainingsphasen.
Große Mengen Text, Code und ggf. multimodaler Daten.
Selbstüberwachtes Lernen der nächsten Tokenverteilung.
Breite statistische Sprach- und Wissensrepräsentation.
Supervised Fine-Tuning auf Instruktionen.
RLHF, DPO oder verwandte Verfahren.
Spezialisierte Post-Training-Schritte.
Prompt, Kontext, Decoding und Test-Time Compute.
Pretraining Objective
Next-Token Prediction wirkt einfach – skaliert aber auf viele Fähigkeiten.
Autoregressives Sprachmodell
- Eingabe
- Tokenfolge x₁ … xₜ
- Ziel
- Wahrscheinlichkeit des nächsten Tokens xₜ₊₁ maximieren
- Loss
- Typischerweise Cross-Entropy zwischen vorhergesagter und tatsächlicher Next-Token-Verteilung
- Self-Supervision
- Der Text selbst liefert die Zieltokens; es müssen nicht für jeden Trainingsschritt manuelle Labels erstellt werden.
- Erlernte Muster
- Syntax, Stil, Faktenkorrelationen, Code-Strukturen, Aufgabenformate und viele weitere statistische Regularitäten können aus der Vorhersageaufgabe entstehen.
- Grenze
- Next-Token Prediction garantiert weder Wahrheit noch Zielausrichtung. Genau deshalb wurden Post-Training und Alignment zu zentralen Entwicklungslinien.
Transformer-Familien
Nicht jeder Transformer ist ein GPT.
BERT-artige Modelle
Bidirektionale Encoder verarbeiten den gesamten Eingabetext und eignen sich besonders für Repräsentations- und Verständnisaufgaben. BERT ist ein wichtiger Pretraining-Meilenstein, aber kein autoregressives GPT.
GPT-artige Modelle
Causal Decoder modellieren die nächste Tokenwahrscheinlichkeit. Diese Architektur wurde zum dominierenden Grundmuster moderner generativer Text- und Chat-LLMs.
T5-artige Modelle
Ein Encoder verarbeitet die Eingabe, ein separater Decoder erzeugt die Ausgabe. Diese Architektur bleibt für Sequenz-zu-Sequenz-Aufgaben relevant.
Historische Entwicklung
Vom neuronalen Sprachmodell zum modernen generativen LLM.
2003 · Neuronale Sprachmodelle
- Paper / Quelle
- Bengio et al. – A Neural Probabilistic Language Model
- Meilenstein
- Wörter werden als gelernte kontinuierliche Vektoren repräsentiert; eine neuronale Funktion modelliert Wortfolgenwahrscheinlichkeiten.
- Bedeutung
- Verteilte Repräsentationen und neuronale Sprachmodellierung bilden eine direkte Grundlage späterer LLMs.
2014 · Attention
- Paper / Quelle
- Bahdanau, Cho & Bengio – Neural Machine Translation by Jointly Learning to Align and Translate
- Meilenstein
- Der Decoder kann bei jedem Ausgabeschritt unterschiedliche Teile der Eingabesequenz gewichten.
- Bedeutung
- Attention beseitigt den festen Encoder-Vektor als alleinigen Informationsengpass.
2015/2016 · Subword-Tokenisierung
- Paper / Quelle
- Sennrich, Haddow & Birch – Neural Machine Translation of Rare Words with Subword Units
- Meilenstein
- Seltene und unbekannte Wörter werden aus kleineren Subword-Einheiten zusammengesetzt.
- Bedeutung
- BPE-artige Verfahren werden zum wichtigen Baustein moderner Tokenizer.
2017 · Transformer
- Paper / Quelle
- Vaswani et al. – Attention Is All You Need
- Meilenstein
- Sequenzverarbeitung wird ohne rekurrente oder convolutionale Hauptstruktur durch Attention-basierte Blöcke umgesetzt.
- Bedeutung
- Die Grundarchitektur späterer GPT-Modelle entsteht.
2018 · GPT-1
- Paper / Quelle
- Radford et al. – Improving Language Understanding by Generative Pre-Training
- Meilenstein
- Generatives Transformer-Pretraining auf unbeschriftetem Text plus Fine-Tuning wird als Transfer-Learning-Verfahren etabliert.
- Bedeutung
- Die namensgebende GPT-Kombination wird sichtbar.
2018 · BERT
- Paper / Quelle
- Devlin et al. – BERT
- Meilenstein
- Bidirektionales Transformer-Pretraining mit Masked Language Modeling erzielt starke Understanding-Ergebnisse.
- Bedeutung
- Zeigt, dass Transformer-Pretraining ein allgemeines NLP-Paradigma mit mehreren Architekturzweigen ist.
2019 · GPT-2
- Paper / Quelle
- Radford et al. – Language Models are Unsupervised Multitask Learners
- Meilenstein
- Größeres autoregressives Pretraining zeigt zunehmend Zero-Shot-Aufgabenverhalten.
- Bedeutung
- Aufgaben können stärker über natürlichen Kontext statt separates Fine-Tuning spezifiziert werden.
2020 · Scaling Laws
- Paper / Quelle
- Kaplan et al. – Scaling Laws for Neural Language Models
- Meilenstein
- Loss zeigt systematische Power-Law-Beziehungen zu Modellgröße, Datenmenge und Compute.
- Bedeutung
- Skalierung wird planbarer und quantifizierbarer.
2020 · GPT-3
- Paper / Quelle
- Brown et al. – Language Models are Few-Shot Learners
- Meilenstein
- Instruktionen und Beispiele im Prompt reichen für viele neue Aufgaben ohne Gradientenupdate.
- Bedeutung
- In-Context Learning und Prompting werden zentrale Nutzungsmuster.
2020–2021 · Moderner Block
- Paper / Quelle
- RMSNorm, SwiGLU, RoPE und Switch Transformer
- Meilenstein
- Normalisierung, MLP, Position und Sparsity werden gegenüber dem Original-Transformer weiterentwickelt.
- Bedeutung
- Viele heute verbreitete LLM-Bausteine entstehen in dieser Phase.
2022 · Chinchilla
- Paper / Quelle
- Hoffmann et al. – Training Compute-Optimal Large Language Models
- Meilenstein
- Unter festem Compute-Budget sollten Modellgröße und Trainingsdaten gemeinsam skaliert werden.
- Bedeutung
- Mehr Parameter allein ist kein compute-optimales Rezept.
2022 · Chain-of-Thought
- Paper / Quelle
- Wei et al. – Chain-of-Thought Prompting
- Meilenstein
- Zwischenschritt-Demonstrationen im Prompt verbessern komplexe Reasoning-Aufgaben großer Modelle.
- Bedeutung
- Reasoning wird als eigener Prompt-, Decoding- und später Post-Training-Bereich sichtbar.
2022 · InstructGPT
- Paper / Quelle
- Ouyang et al. – Training language models to follow instructions with human feedback
- Meilenstein
- Supervised Demonstrationen, Präferenzdaten und RLHF verbessern das Befolgen von Nutzerintentionen.
- Bedeutung
- Post-Training wird neben Pretraining zur zweiten entscheidenden Modellphase.
2022 · FlashAttention
- Paper / Quelle
- Dao et al. – FlashAttention
- Meilenstein
- Exakte Attention wird IO-aware implementiert und reduziert Speichertransfers.
- Bedeutung
- Hardware- und Kernel-Effizienz werden zu eigenständigen Fortschrittshebeln.
2023 · LLaMA
- Paper / Quelle
- Touvron et al. – LLaMA
- Meilenstein
- Relativ kleinere, intensiv auf vielen Tokens trainierte Foundation Models erreichen sehr starke Leistung.
- Bedeutung
- Effiziente Trainingsrezepte und offene Modellfamilien beschleunigen das Ökosystem.
2023 · GPT-4
- Paper / Quelle
- GPT-4 Technical Report
- Meilenstein
- Text- und Bildeingaben werden in einem großen Transformer-basierten Modell kombiniert.
- Bedeutung
- Multimodalität wird zum Frontier-Merkmal.
2023 · DPO
- Paper / Quelle
- Rafailov et al. – Direct Preference Optimization
- Meilenstein
- Präferenzdaten können direkt zur Optimierung des Sprachmodells verwendet werden.
- Bedeutung
- Preference Optimization wird methodisch einfacher und breiter.
2023 · GQA
- Paper / Quelle
- Ainslie et al. – Grouped-Query Attention
- Meilenstein
- Weniger Key-/Value-Heads reduzieren Speicher- und Inferenzkosten bei ähnlicher Qualität.
- Bedeutung
- KV-Cache und Speicherbandbreite werden zentrale Decoder-Optimierungsziele.
2024 · Long Context
- Paper / Quelle
- Gemini 1.5 Technical Report
- Meilenstein
- Sehr große multimodale Kontextfenster werden für lange Dokumente, Video und Audio demonstriert.
- Bedeutung
- Kontextlänge wird zu einer eigenen Skalierungsdimension.
2024 · Test-Time Compute
- Paper / Quelle
- Snell et al. – Scaling LLM Test-Time Compute Optimally
- Meilenstein
- Zusätzlicher Inferenzcompute kann auf geeigneten schwierigen Aufgaben effizienter sein als ausschließlich größere Modelle.
- Bedeutung
- Inference-Time Scaling wird zu einer neuen Leistungsachse.
2025 · Reasoning RL
- Paper / Quelle
- DeepSeek-R1
- Meilenstein
- Reinforcement Learning auf verifizierbaren Aufgaben kann komplexere Reasoning-Strategien fördern.
- Bedeutung
- Reasoning-orientiertes Post-Training wird zu einer zentralen Frontier-Linie.
2025–heute · Hybridisierung
- Paper / Quelle
- Qwen3 Technical Report und aktuelle Modellfamilien
- Meilenstein
- Dense- und MoE-Architekturen, mehrsprachige Daten, Long Context und Thinking Modes koexistieren.
- Bedeutung
- Fortschritt entsteht aus Architektur, Daten, Post-Training, Kontext und Inferenzcompute als Gesamtsystem.
Fortschrittsdimensionen
Was wurde seit dem ursprünglichen Transformer eigentlich verbessert?
Mehr Parameter und Compute erhöhten Kapazität, waren aber nie die einzige Variable.
Mehr Tokens, bessere Datenmischungen, Deduplication und Qualitätsfilter verbesserten Generalisierung.
RoPE, RMSNorm, SwiGLU, GQA und MoE veränderten einzelne Bausteine.
Scaling Laws und Chinchilla-artige Compute-Optimierung verbesserten die Allokation zwischen Parametern und Daten.
FlashAttention, Parallelisierung, niedrigere Präzision und optimierte Kernels senkten reale Kosten.
Instruction Tuning, RLHF, DPO und Reasoning-RL machten aus Base Models besser steuerbare Assistenten.
Größere Fenster und Context-Management-Techniken erweiterten Langzeitaufgaben.
Reasoning und Test-Time Scaling erlauben dynamisch mehr Rechenaufwand für schwierige Anfragen.
Moderner Transformer-Block
Ein heutiger GPT-Block ist dem Original ähnlich – aber nicht identisch.
Typische moderne Varianten
- Normalization
- Häufig Pre-Norm und RMSNorm statt ausschließlich ursprünglicher Post-LayerNorm-Strukturen.
- Position
- RoPE oder verwandte relative Positionsverfahren statt rein sinusförmiger additiver Positionskodierung.
- Attention
- Multi-Head, Grouped-Query, Multi-Query oder andere Varianten zur Balance aus Qualität und Inferenzkosten.
- MLP
- Gated Feed-Forward-Netze wie SwiGLU statt einfacher ReLU-Strukturen.
- Sparsity
- Bei MoE-Modellen werden pro Token nur ausgewählte Expert-Netze aktiviert.
- Implementation
- FlashAttention und optimierte Kernels verändern nicht zwingend die Mathematik des Modells, aber die praktische Effizienz.
Post-Training
Warum ein Base Model noch kein guter Chat-Assistent ist.
Next-Token-Kompetenz
Das vortrainierte Modell setzt Textwahrscheinlichkeiten fort, besitzt aber keine Garantie, Anweisungen konsistent oder hilfreich zu befolgen.
Instruction Demonstrations
Supervised Fine-Tuning zeigt gewünschte Prompt-Antwort-Muster und Aufgabenformate.
Menschliche Präferenzen
Bewertungen alternativer Antworten werden zu einem Trainingssignal für gewünschteres Verhalten.
Direkte Preference Optimization
Präferenzpaare können direkt zur Optimierung des Sprachmodells verwendet werden.
Verifizierbare Aufgaben
Bei Mathematik, Code und anderen verifizierbaren Domänen kann RL stärker an objektiv prüfbare Ergebnisse gekoppelt werden.
Verhaltensgrenzen
Zusätzliche Daten, Evaluations- und Trainingsverfahren sollen riskantes oder unerwünschtes Verhalten reduzieren.
Inference
Auch nach dem Training beeinflusst die Laufzeit das Ergebnis.
Wichtige Inferenzfaktoren
- Prompt
- Instruktionen, Beispiele und Kontext konditionieren die Tokenverteilung.
- Temperature
- Steuert, wie stark die Wahrscheinlichkeitsverteilung abgeflacht oder konzentriert wird.
- Top-p / Top-k
- Beschränken die Auswahlmenge möglicher Tokens beim Sampling.
- KV Cache
- Speichert Attention-Zwischenergebnisse vorheriger Tokens für effizientere Generation.
- Test-Time Compute
- Ein System kann bei komplexen Aufgaben mehr Such-, Prüf- oder Reasoning-Schritte verwenden.
- Tools / RAG
- Externe Suche, Datenbanken oder Tools können zusätzliche Informationen liefern; sie erweitern das LLM-System, sind aber nicht identisch mit dem Basismodell.
Scaling
„Größer“ wurde schrittweise durch „compute-optimal“ ergänzt.
Bestimmen einen Teil der Modellkapazität und Inferenzkosten.
Ein großes Modell benötigt ausreichend Trainingsdaten, um seine Kapazität sinnvoll auszunutzen.
Die Zusammensetzung der Trainingsdaten kann ebenso wichtig sein wie ihre reine Menge.
Compute-Budget verbindet Modellgröße, Datenmenge und Optimierung.
MoE-Modelle können deutlich mehr Gesamtparameter als pro Token aktivierte Parameter besitzen.
Reasoning-orientierte Systeme können Leistung zusätzlich über Rechenaufwand zur Laufzeit skalieren.
Systemgrenze
Was gehört zum LLM – und was gehört zum System um das LLM?
Parameter und neuronale Architektur
Tokenizer-Konfiguration, Embeddings, Transformer-Blöcke, Normalisierung, Attention, MLP und Output Head bilden den Kern des Modells.
Temporäre Laufzeitinformation
Systemprompt, Nutzerchat, Tool-Ergebnisse und Dokumente können in das Context Window gegeben werden, ohne Teil der trainierten Parameter zu werden.
Externer Wissenszugriff
Retrieval-Systeme wählen zusätzliche Informationen aus externen Wissensquellen aus und ergänzen den Modellkontext.
RAG öffnenAktionen und externe Berechnungen
Browser, Code-Interpreter, APIs oder Datenbanken können von einem Modell orchestriert werden, sind aber separate Komponenten.
Persistenter Kontext außerhalb des Modells
Memory-Systeme speichern Informationen über einzelne Context Windows hinweg.
LLM plus Steuerlogik
Ein Agent kombiniert das Modell häufig mit Tools, Memory, Planung, Retrieval und Schleifen für mehrstufige Aufgaben.
Grenzen
Technischer Fortschritt löst nicht automatisch alle Grundprobleme.
Persistente Herausforderungen
- Halluzinationen
- Wahrscheinliche sprachliche Fortsetzungen sind nicht automatisch faktisch korrekt.
- Knowledge Freshness
- Parameterwissen wird nicht automatisch mit aktuellen Ereignissen synchronisiert.
- Context Limits
- Auch sehr große Kontextfenster haben Kapazitäts-, Kosten- und Nutzungsgrenzen.
- Reasoning Reliability
- Mehr Reasoning-Compute kann Leistung steigern, garantiert aber keine Fehlerfreiheit.
- Data Bias
- Trainingsdaten beeinflussen Sprache, Wissen, Lücken und Verzerrungen des Modells.
- Evaluation
- Benchmark-Leistung ist nicht identisch mit zuverlässigem Verhalten in offenen realen Aufgaben.
- Interpretability
- Die interne Repräsentation komplexen Wissens in Milliarden Parametern ist nur begrenzt direkt interpretierbar.
Verwandte Entitäten
Weiterführende Leadterion-Wissensobjekte.
Retrieval-Augmented Generation
Erklärt, wie externe Wissensquellen zur Laufzeit in den Kontext eines generativen Modells eingebunden werden.
Wissensbeitrag öffnenContext Folding
Behandelt die aktive Verdichtung wachsender Arbeitskontexte in langen LLM- und Agenten-Workflows.
Wissensbeitrag öffnenItemRAG
Überträgt Retrieval-Augmented Generation auf strukturierte Produktobjekte, Attribute und Relationen.
Wissensbeitrag öffnenE-E-A-T
Ordnet Experience, Expertise, Authoritativeness und Trustworthiness als Qualitäts- und Vertrauenskonzept ein.
Wissensbeitrag öffnenFAQ
Häufige Fragen zu Large Language Models und GPT.
Wofür steht GPT?
GPT steht für Generative Pre-trained Transformer: ein generatives Modell, das zunächst großflächig vortrainiert wird und auf einer Transformer-Architektur basiert.
Ist jedes LLM ein Transformer?
Nein. „Large Language Model“ beschreibt keine einzelne Architektur. Die heute dominierenden generativen LLMs sind jedoch überwiegend Transformer-basiert.
Was ist der wichtigste Bestandteil eines GPT-Modells?
Es gibt keinen einzelnen Baustein, der allein das Modell erklärt. Der zentrale Architekturmechanismus ist Self-Attention innerhalb wiederholter Transformer-Blöcke; ebenso notwendig sind Tokenisierung, Embeddings, Positionsinformation, MLPs, Normalisierung und Output Head.
Speichert ein LLM Wissen wie eine Datenbank?
Nein. Das während des Trainings gelernte Wissen ist verteilt in den Modellgewichten repräsentiert. Einzelne Fakten lassen sich nicht so direkt adressieren oder aktualisieren wie Zeilen einer klassischen Datenbank.
Warum wurde GPT-3 historisch wichtig?
GPT-3 zeigte besonders deutlich, dass ein ausreichend großes autoregressives Sprachmodell viele Aufgaben allein über Instruktionen und Beispiele im Prompt ausführen kann, ohne für jede Aufgabe neu feinabgestimmt zu werden.
Warum ist Chinchilla ein wichtiger Meilenstein?
Die Arbeit zeigte, dass unter einem gegebenen Trainingscompute nicht einfach nur die Parameterzahl maximiert werden sollte. Modellgröße und Menge der Trainingsdaten müssen gemeinsam sinnvoll skaliert werden.
Was änderte RLHF an LLMs?
RLHF adressiert primär das Verhalten gegenüber Nutzerintentionen. Präferenzdaten werden genutzt, um hilfreichere und besser steuerbare Antworten zu fördern.
Sind Reasoning-Modelle eine völlig neue Architektur?
Nicht zwingend. Ein großer Teil des aktuellen Reasoning-Fortschritts entsteht durch Post-Training, Reinforcement Learning, Verifier, Sampling und zusätzlichen Test-Time Compute auf weiterhin Transformer-basierten Grundmodellen.
Gehören RAG und Tools zum LLM?
Sie können Teil eines LLM-basierten Systems sein, sind aber normalerweise externe Komponenten. Das LLM selbst ist das trainierte neuronale Modell; Retrieval, APIs, Browser, Memory und Agentenlogik liegen darum herum.
Quellen
Wissenschaftliche Meilensteine der LLM- und GPT-Entwicklung.
Die Auswahl konzentriert sich auf Arbeiten, die zentrale Architektur-, Trainings-, Skalierungs- und Inferenzmeilensteine der Entwicklung moderner Large Language Models markieren.
| Jahr / Quelle | Arbeit | Maßgebliche Erkenntnis | Originalquelle |
|---|---|---|---|
| 2003 · JMLR | A Neural Probabilistic Language Model Yoshua Bengio et al. | Neuronale Wahrscheinlichkeitsmodelle lernen verteilte Wortrepräsentationen und bilden eine frühe Grundlage neuronaler Sprachmodellierung. | JMLR |
| 2014 · ICLR | Neural Machine Translation by Jointly Learning to Align and Translate Dzmitry Bahdanau, Kyunghyun Cho & Yoshua Bengio | Attention erlaubt eine dynamische Gewichtung relevanter Eingabepositionen. | arXiv:1409.0473 |
| 2015/2016 · ACL | Neural Machine Translation of Rare Words with Subword Units Rico Sennrich, Barry Haddow & Alexandra Birch | Subword-Segmentierung mit BPE macht offene Vokabulare praktikabler. | arXiv:1508.07909 |
| 2017 · NeurIPS | Attention Is All You Need Ashish Vaswani et al. | Begründet die Transformer-Architektur als vollständig Attention-basiertes Sequenzmodell. | arXiv:1706.03762 |
| 2018 · OpenAI | Improving Language Understanding by Generative Pre-Training Alec Radford et al. | Generatives Transformer-Pretraining plus Fine-Tuning etabliert das GPT-Transfer-Learning-Muster. | OpenAI Paper |
| 2018/2019 · NAACL | BERT Jacob Devlin et al. | Bidirektionales Transformer-Pretraining zeigt die Breite des Pretraining-Paradigmas. | arXiv:1810.04805 |
| 2019 · OpenAI | Language Models are Unsupervised Multitask Learners Alec Radford et al. | GPT-2 zeigt zunehmendes Zero-Shot-Aufgabenverhalten mit großem generativem Pretraining. | OpenAI Paper |
| 2019 · NeurIPS | Root Mean Square Layer Normalization Biao Zhang & Rico Sennrich | RMSNorm vereinfacht Normalisierung und wird später verbreitet in LLMs eingesetzt. | arXiv:1910.07467 |
| 2020 · arXiv | Scaling Laws for Neural Language Models Jared Kaplan et al. | Beschreibt systematische Skalierungsbeziehungen zu Modellgröße, Daten und Compute. | arXiv:2001.08361 |
| 2020 · NeurIPS | Language Models are Few-Shot Learners Tom B. Brown et al. | GPT-3 etabliert Few-Shot und In-Context Learning als zentrales Nutzungsmuster. | arXiv:2005.14165 |
| 2020 · arXiv | GLU Variants Improve Transformer Noam Shazeer | Gated Feed-Forward-Varianten wie SwiGLU verbessern Transformer-MLPs. | arXiv:2002.05202 |
| 2021/2022 · JMLR | Switch Transformers William Fedus, Barret Zoph & Noam Shazeer | Sparse Mixture-of-Experts kombiniert viele Gesamtparameter mit sparsamer Aktivierung. | arXiv:2101.03961 |
| 2021 · RoFormer | RoFormer: Enhanced Transformer with Rotary Position Embedding Jianlin Su et al. | RoPE integriert Positionsinformation in die Attention-Geometrie. | arXiv:2104.09864 |
| 2022 · DeepMind | Training Compute-Optimal Large Language Models Jordan Hoffmann et al. | Chinchilla verschiebt den Fokus von reiner Parametergröße zu compute-optimaler Balance aus Modell und Daten. | arXiv:2203.15556 |
| 2022/2023 · NeurIPS | Chain-of-Thought Prompting Elicits Reasoning in Large Language Models Jason Wei et al. | Zwischenschritt-Demonstrationen können komplexes Reasoning großer Modelle verbessern. | arXiv:2201.11903 |
| 2022 · NeurIPS | Training language models to follow instructions with human feedback Long Ouyang et al. | Instruction Fine-Tuning plus RLHF macht aus Base Models besser steuerbare Assistenten. | arXiv:2203.02155 |
| 2022 · NeurIPS | FlashAttention Tri Dao et al. | IO-aware exakte Attention reduziert Speichertransfers und beschleunigt Training und lange Sequenzen. | arXiv:2205.14135 |
| 2023 · arXiv | LLaMA: Open and Efficient Foundation Language Models Hugo Touvron et al. | Effizient trainierte, zugänglichere Foundation Models beschleunigen das offene LLM-Ökosystem. | arXiv:2302.13971 |
| 2023 · arXiv | GPT-4 Technical Report OpenAI et al. | Multimodale Eingaben und stark skaliertes Transformer-Pretraining markieren eine neue Frontier-Phase. | arXiv:2303.08774 |
| 2023 · NeurIPS | Direct Preference Optimization Rafael Rafailov et al. | Präferenzlernen wird als direktes Optimierungsproblem für Sprachmodelle formuliert. | arXiv:2305.18290 |
| 2023 · EMNLP | GQA: Training Generalized Multi-Query Transformer Models Joshua Ainslie et al. | Grouped-Query Attention verbessert den Trade-off zwischen Qualität, KV-Cache-Größe und Geschwindigkeit. | ACL Anthology |
| 2024 · Technical Report | Gemini 1.5 Gemini Team | Sehr lange multimodale Kontextfenster etablieren Kontextlänge als eigene Frontier-Dimension. | arXiv:2403.05530 |
| 2024 · arXiv | Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters Charlie Snell et al. | Zusätzlicher Inferenzcompute wird als eigene Skalierungsachse untersucht. | arXiv:2408.03314 |
| 2025 · Nature | DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning DeepSeek-AI et al. | Reasoning-orientiertes Reinforcement Learning wird zu einer zentralen Post-Training-Linie. | Nature DOI |
| 2025 · Technical Report | Qwen3 Technical Report An Yang et al. | Aktuelle Modellfamilien kombinieren dense und MoE-Modelle, Mehrsprachigkeit und reasoning-orientierte Betriebsmodi. | arXiv:2505.09388 |
Wissen
Der moderne LLM-Fortschritt ist die Kombination vieler kleiner und großer Verbesserungen.
Der Transformer von 2017 ist weiterhin klar erkennbar. Seine heutige Leistungsfähigkeit entsteht jedoch aus Jahrzehnten neuronaler Sprachmodellierung und aus Fortschritten bei Tokenisierung, Daten, Skalierung, Attention, Normalisierung, sparsamer Aktivierung, Post-Training, Hardware-Nutzung, Kontext und zusätzlichem Inferenzcompute.