LLM Grundlagen
LLM Grundlagen
Large Language Models verstehen – von der Transformer-Architektur über Tokenisierung und Training bis zu Fine-Tuning, Inference und praktischen Anwendungen. Ihr Fundament für KI-Engineering.
Inhaltsverzeichnis
Schnellübersicht
Auf dieser Seite lernen Sie die wichtigsten Konzepte von Large Language Models:
- Was sind LLMs? Definition und Grundprinzip
- Transformer-Architektur: Self-Attention, Encoder/Decoder
- Tokenisierung: Wie Text in Zahlen umgewandelt wird
- Training: Pre-Training, Next-Token-Prediction
- Fine-Tuning: Anpassung an spezifische Aufgaben
- Inference: Wie LLMs Texte generieren
- Modelle im Vergleich: GPT, Claude, Llama, Mistral
- Anwendungsfälle: Chat, Code, Content, Analyse
- FAQ: Häufige Fragen zu LLMs
1. Was sind Large Language Models?
Definition
Large Language Models (LLMs) sind neuronale Netze mit Milliarden von Parametern, die auf riesigen Textmengen trainiert wurden. Sie lernen statistische Muster in Sprache und können dadurch Text verstehen, generieren, übersetzen, zusammenfassen und viele weitere sprachliche Aufgaben bewältigen.
Das Grundprinzip ist überraschend einfach: LLMs sagen das nächste Wort (Token) in einer Sequenz voraus. Durch diese scheinbar simple Aufgabe emergieren komplexe Fähigkeiten wie Reasoning, Code-Generierung und kreatives Schreiben.
Wichtige Kennzahlen: Moderne LLMs haben 7–500+ Milliarden Parameter, wurden mit Billionen von Tokens trainiert und benötigen tausende GPUs für das Training.
Warum funktionieren LLMs so gut?
- Skalierungsgesetze: Mehr Parameter + mehr Daten + mehr Compute = bessere Performance
- Emergente Fähigkeiten: Ab bestimmten Größenordnungen entstehen neue Fähigkeiten (Reasoning, Few-Shot Learning)
- Transfer Learning: Einmal trainiert, kann das Modell für viele Aufgaben angepasst werden
- In-Context Learning: LLMs lernen aus Beispielen im Prompt, ohne Gewichte anzupassen
2. Die 6 Kernkonzepte von LLMs
Klicken Sie auf ein Konzept, um direkt zur detaillierten Erklärung zu gelangen.
Transformer
Die Transformer-Architektur (2017) revolutionierte NLP. Self-Attention ermöglicht parallele Verarbeitung und das Erfassen langer Abhängigkeiten.
- Self-Attention-Mechanismus
- Multi-Head Attention
- Positional Encoding
- Feed-Forward Networks
Tokenisierung
LLMs verarbeiten keine Buchstaben, sondern Tokens. Tokenizer zerlegen Text in sinnvolle Einheiten (Subwords, Wörter, Zeichen).
- Byte-Pair Encoding (BPE)
- WordPiece, SentencePiece
- Vokabular-Größe (32k–128k)
- Special Tokens (BOS, EOS, PAD)
Training
LLMs werden in zwei Phasen trainiert: Pre-Training auf riesigen Textkorpora, dann Fine-Tuning für spezifische Aufgaben.
- Next-Token-Prediction
- Masked Language Modeling
- Skalierungsgesetze
- Compute-Optimal Training
Fine-Tuning
Nach dem Pre-Training werden LLMs durch Fine-Tuning an bestimmte Domänen oder Aufgaben angepasst – effizient und gezielt.
- Supervised Fine-Tuning (SFT)
- RLHF / RLAIF
- LoRA / QLoRA
- Instruction Tuning
Inference
Inference ist der Prozess der Textgenerierung. Sampling-Strategien steuern Kreativität vs. Determinismus.
- Autoregressive Generierung
- Temperature & Top-k/Top-p
- KV-Cache Optimierung
- Quantisierung (INT8, INT4)
Context Window
Das Context Window definiert die maximale Anzahl Tokens, die ein LLM gleichzeitig verarbeiten kann – entscheidend für lange Dokumente.
- 4K – 200K+ Tokens
- RoPE & ALiBi Positional Encoding
- Needle-in-a-Haystack Tests
- Long-Context vs. RAG
3. Wie werden LLMs trainiert?
Das Training eines LLM ist ein mehrstufiger, ressourcenintensiver Prozess, der Monate dauern und Millionen von Dollar kosten kann.
Die 3 Phasen des LLM-Trainings
Pre-Training
Das Modell lernt allgemeine Sprachmuster aus Billionen von Texten (Internet, Bücher, Code). Es versucht, das nächste Wort vorherzusagen. Dies ist die teuerste Phase.
Supervised Fine-Tuning (SFT)
Das Modell wird mit hochwertigen Frage-Antwort-Paaren trainiert, um nützlicher und gesprächiger zu werden. Menschliche Trainer erstellen diese Datensätze.
RLHF
Reinforcement Learning from Human Feedback. Menschen bewerten Antworten, ein Reward-Modell lernt daraus und optimiert das LLM für menschliche Präferenzen (Hilfreichkeit, Ehrlichkeit, Harmlosigkeit).
Hardware-Anforderungen
Für das Training großer Modelle werden Clusters aus tausenden speziellen GPUs (NVIDIA A100/H100) oder TPUs benötigt. Der Speicherbedarf liegt oft im Terabyte-Bereich, und das Training verbraucht so viel Strom wie eine kleine Stadt.
4. Wichtige Konzepte & Begriffe
Um LLMs effektiv zu nutzen, sollten Sie diese technischen Begriffe verstehen.
Tokens & Embeddings
- Token: Kleinste Einheit, die das Modell verarbeitet (Wortteil)
- Embedding: Numerische Darstellung eines Tokens in einem hochdimensionalen Raum
- Ähnliche Wörter haben ähnliche Embedding-Vektoren
- Beispiel: "König" - "Mann" + "Frau" ≈ "Königin"
Context Window
- Maximale Menge an Text, die das Modell gleichzeitig "sehen" kann
- Gemessen in Tokens (z.B. 4k, 32k, 128k, 1M+)
- Größeres Fenster = besserer Kontext, aber höherer Rechenaufwand
- Alles außerhalb des Fensters wird "vergessen"
Halluzinationen
- Wenn das Modell falsche Informationen als Fakten präsentiert
- Entsteht, weil das Modell Wahrscheinlichkeiten, nicht Wahrheiten lernt
- Kann durch RAG (Retrieval Augmented Generation) reduziert werden
- Kritisches Problem für medizinische/juristische Anwendungen
Temperature & Parameter
- Temperature: Steuert die Zufälligkeit der Ausgabe (0 = deterministisch, 1 = kreativ)
- Top-P / Top-K: Begrenzt die Auswahl der nächsten Tokens
- Fine-Tuning: Anpassen eines Basis-Modells auf spezifische Daten
- Prompt Engineering: Optimieren der Eingabe für bessere Ergebnisse
5. Die Transformer-Architektur
Der Transformer (Vaswani et al., 2017) ist die Grundlage aller modernen LLMs. Er ersetzt rekurrente Netze durch Self-Attention und ermöglicht paralleles Training.
Transformer-Schichten im Überblick
Input Text
Roh-Text wird vom Tokenizer in Token-IDs umgewandelt
Multi-Head Self-Attention
Jedes Token attendiert auf alle anderen Tokens – erfasst Kontext und Abhängigkeiten
Feed-Forward Network
Nicht-lineare Transformation pro Token – speichert Wissen in den Gewichten
Output Head
Lineare Schicht + Softmax → Wahrscheinlichkeiten für nächstes Token
Warum Self-Attention so mächtig ist
- Lange Abhängigkeiten: Jedes Token kann direkt auf jedes andere Token attendieren (keine sequentielle Verarbeitung)
- Parallelisierbarkeit: Alle Tokens werden gleichzeitig verarbeitet → effizientes GPU-Training
- Interpretierbarkeit: Attention-Weights zeigen, worauf das Modell „achtet"
- Skalierbarkeit: Mehr Heads, mehr Layer, mehr Dimensionen → bessere Performance
6. Tokenisierung – Text in Zahlen
LLMs verstehen keinen Text direkt. Stattdessen wird Text in Tokens zerlegt – kleine Einheiten, die als Zahlen repräsentiert werden.
Modern Tokenizer verwenden Subword-Algorithmen, die häufige Zeichenfolgen zu Tokens zusammenfassen:
- BPE (Byte-Pair Encoding): GPT-Familie – beginnt mit Bytes, merged häufige Paare
- WordPiece: BERT – maximiert Likelihood des Vokabulars
- SentencePiece: Sprachunabhängig, arbeitet direkt auf UTF-8 Bytes
- Unigram: T5 – probabilistisches Subword-Modell
Ein Satz wird in Tokens zerlegt – nicht immer ganze Wörter:
"ChatGPT" → ["Chat", "G", "PT"]
"🚀" → [2 bytes]
"Hello world" → ["Hello", " world"]
Faustregel: 1 Token ≈ 4 Zeichen (Englisch), ≈ 1,5 Zeichen (Deutsch)
Tokenizer verwenden spezielle Kontroll-Tokens:
<BOS>– Begin of Sequence (Start)<EOS>– End of Sequence (Ende)<PAD>– Padding (Auffüllen)<UNK>– Unknown (unbekanntes Token)<SYSTEM>– System-Prompt Marker
7. Training – Wie LLMs lernen
Das Training von LLMs erfolgt in mehreren Phasen – von rohem Text zu einem hilfreichen Assistenten.
Ziel: Next-Token-Prediction auf Billionen von Tokens aus dem Internet, Büchern, Code.
- Datenmenge: 1–15 Billionen Tokens
- Compute: Tausende GPUs über Monate
- Kosten: $10M–$100M+
- Ergebnis: Basis-Modell (Base Model) – kennt Sprache, aber folgt keinen Anweisungen
Ziel: Modell lernt, Anweisungen zu folgen – trainiert auf Frage-Antwort-Paaren.
- Daten: 10K–500K hochwertige Beispiele
- Format: Instruction → Response Paare
- Ergebnis: Instruct-Modell – folgt Anweisungen, aber kann noch unsicher/unhilfreich sein
Ziel: Modell wird hilfreich, ehrlich und harmlos – Alignment mit menschlichen Werten.
- RLHF: Reinforcement Learning from Human Feedback
- RLAIF: AI Feedback statt Human Feedback (skalierbarer)
- DPO: Direct Preference Optimization (einfacher als RLHF)
- Ergebnis: Chat-Modell – sicher, hilfreich, aligned
Skalierungsgesetze (Scaling Laws)
Die Performance von LLMs folgt vorhersagbaren Gesetzen (Kaplan et al., 2020; Chinchilla, 2022):
- Loss ∝ N-α · D-β · C-γ – Loss sinkt mit mehr Parametern (N), Daten (D) und Compute (C)
- Chinchilla-Optimal: Für optimales Training sollten Parameter und Daten proportional skaliert werden
- Emergent Abilities: Ab ~100B Parametern entstehen plötzlich neue Fähigkeiten (Chain-of-Thought, Few-Shot)
8. Fine-Tuning – Modelle anpassen
Fine-Tuning passt ein vortrainiertes LLM an spezifische Aufgaben, Domänen oder Formate an – deutlich günstiger als Training von Grund auf.
Alle Parameter werden aktualisiert. Beste Qualität, aber teuer und speicherintensiv.
- Benötigt volle GPU-Speicher für Modell + Optimizer States
- Geeignet für: Große Datensätze, fundamentale Anpassungen
- Kosten: Hoch (mehrere A100/H100)
Low-Rank Adaptation: Nur kleine Adapter-Matrizen werden trainiert, Basis-Modell bleibt eingefroren.
- LoRA: Trainiert Low-Rank-Matrizen (rank 8–64)
- QLoRA: Kombiniert LoRA mit 4-Bit-Quantisierung → läuft auf Consumer-GPUs
- Speicherbedarf: ~10-20% von Full Fine-Tuning
- Geeignet für: Domänen-Anpassung, Format-Training
Modell lernt, Anweisungen zu folgen – trainiert auf vielfältigen Task-Beschreibungen.
- Datenformat:
### Instruction:\n...\n### Response:\n... - Diversität wichtig: Viele verschiedene Aufgabentypen
- Qualität > Quantität: 10K hochwertige Beispiele > 100K mittelmäßige
9. Inference – Textgenerierung
Inference ist der Prozess, bei dem ein trainiertes LLM Text generiert. Understanding the sampling strategies is key to controlling output quality.
Wie wird das nächste Token ausgewählt?
- Greedy: Immer das wahrscheinlichste Token → deterministisch, aber repetitiv
- Temperature: Steuert Zufälligkeit (0.0 = greedy, 1.0 = normal, 2.0 = kreativ)
- Top-k: Nur die k wahrscheinlichsten Tokens werden berücksichtigt
- Top-p (Nucleus): Tokens werden ausgewählt, bis kumulative Wahrscheinlichkeit p erreicht
Inference ist oft der Flaschenhals – Optimierungen sind entscheidend:
- KV-Cache: Speichert Key/Value-Paare → vermeidet Neuberechnung
- Quantization: INT8/INT4 reduziert Speicherbedarf 2-4×
- Speculative Decoding: Kleines Modell draftet, großes verifiziert
- Batching: Mehrere Requests parallel verarbeiten
- vLLM / TensorRT-LLM: Optimierte Inference-Engines
10. Beliebte LLMs im Vergleich
Übersicht der wichtigsten Open-Weight und proprietären Modelle (Stand 2026).
| Modell | Hersteller | Parameter | Context | Lizenz | Stärken |
|---|---|---|---|---|---|
| GPT-4o | OpenAI | ~1.8T (MoE) | 128K | Proprietär | Allrounder, Multimodal |
| Claude 3.5 Sonnet | Anthropic | ~200B | 200K | Proprietär | Coding, Analysis, Safety |
| Llama 3.1 405B | Meta | 405B | 128K | Llama License | Open-Weight Leader, Fine-Tuning |
| Qwen2.5 72B | Alibaba | 72B | 128K | Apache 2.0 | Multilingual, Coding, Math |
| Mistral Large 2 | Mistral AI | 123B | 128K | Mistral License | Effizienz, European AI |
| Gemini 1.5 Pro | ~1T (MoE) | 2M | Proprietär | Longest Context, Multimodal | |
| DeepSeek-V3 | DeepSeek | 671B (MoE) | 128K | MIT | Coding, Reasoning, Open |
Open-Weight vs. Proprietär
Open-Weight Modelle (Llama, Qwen, Mistral) bieten volle Kontrolle, Datenschutz und Anpassbarkeit. Proprietäre Modelle (GPT-4, Claude, Gemini) sind oft leistungsfähiger, aber weniger transparent und teurer im Betrieb. Für Enterprise-Anwendungen mit sensiblen Daten sind Open-Weight-Modelle mit lokalem Hosting oft die bessere Wahl.
11. Praktische Anwendungsfälle
LLMs werden in vielen Bereichen eingesetzt – hier die wichtigsten Kategorien.
Conversational AI
Chatbots, Customer Support, interne Assistenten. LLMs führen natürliche Gespräche und beantworten Fragen.
Code-Generierung
LLMs schreiben, erklären und debuggen Code. Copilots steigern Entwickler-Produktivität um 30-50%.
Content Creation
Texte verfassen, zusammenfassen, umschreiben. Marketing, Dokumentation, E-Mails.
Datenanalyse
Strukturierte Daten analysieren, Insights extrahieren, SQL generieren, Reports erstellen.
Übersetzung
Hochwertige Übersetzungen zwischen 100+ Sprachen. Kontextbewusst und domänenspezifisch.
RAG (Retrieval Augmented)
LLMs + externe Wissensdatenbanken. Aktuelle, domänenspezifische Antworten ohne Halluzinationen.
12. FAQ – Häufige Fragen zu LLMs
Häufig gestellte Fragen
Nein, nicht im menschlichen Sinne. LLMs haben kein Bewusstsein oder Verständnis. Sie sind statistische Maschinen, die basierend auf Wahrscheinlichkeiten das nächste Wort vorhersagen. Durch die enorme Datenmenge und komplexe Architektur wirken die Antworten jedoch oft sehr intelligent und kontextbezogen. Man nennt dies "Emergent Abilities".
- Parameter: Die "Gewichte" im neuronalen Netz. Je mehr Parameter, desto komplexer und leistungsfähiger ist das Modell (z.B. GPT-3 hat 175 Milliarden Parameter).
- Tokens: Die Einheiten, in die der Eingabe- und Ausgabetext zerlegt wird. Ein Token ist oft ein Wort oder ein Teil eines Wortes. Die Anzahl der Tokens bestimmt die Länge des Textes, den das Modell verarbeiten kann.
LLMs sind darauf trainiert, plausible Texte zu generieren, nicht unbedingt faktisch korrekte. Wenn das Modell eine Frage nicht sicher beantworten kann, erfindet es oft eine Antwort, die sprachlich korrekt klingt, aber faktisch falsch ist. Dies liegt daran, dass das Modell keine echte Wissensdatenbank hat, sondern nur statistische Muster.
Lösung: Nutzung von RAG (Retrieval Augmented Generation), bei dem das Modell auf externe, verifizierte Quellen zugreift.
Ja, aber es hängt von der Größe des Modells ab.
- Kleine Modelle (7B Parameter): Laufen auf modernen Gaming-PCs mit 16-32 GB RAM (quantisiert).
- Mittlere Modelle (13B-30B): Benötigen leistungsstarke GPUs mit viel VRAM (24GB+).
- Große Modelle (70B+): Benötigen meist mehrere High-End-GPUs oder Server-Hardware.
Tools wie Ollama, LM Studio oder LocalAI machen das lokale Ausführen sehr einfach.
Quantisierung reduziert die Präzision der Zahlen, die die Parameter des Modells darstellen (z.B. von 16-Bit auf 4-Bit). Dies verringert den Speicherbedarf und die Rechenleistung erheblich, bei nur minimalem Verlust der Genauigkeit. Dadurch können große Modelle auf kleinerer Hardware laufen.
Base-Modelle (z.B. Llama-3-70B-Base) sind nur mit Next-Token-Prediction trainiert. Sie vervollständigen Text, folgen aber keinen Anweisungen. Sie sind gut für Few-Shot-Learning und Forschung.
Instruct-/Chat-Modelle (z.B. Llama-3-70B-Instruct) wurden zusätzlich mit SFT und RLHF trainiert. Sie folgen Anweisungen, sind hilfsbereiter und sicherer. Für die meisten Anwendungen sollten Sie Instruct-Modelle verwenden.
Das hängt von der Aufgabe ab:
- Einfache Klassifikation/Extraktion: 7B–13B reichen oft aus
- Chat, Zusammenfassung: 30B–70B für gute Qualität
- Komplexes Reasoning, Coding: 70B+ oder proprietäre Modelle
- Domänenspezifisch: Kleineres Modell + Fine-Tuning kann besser sein als größeres Base-Modell
Tipp: Starten Sie klein und skalieren Sie nur, wenn nötig. Fine-Tuning eines 7B-Modells ist oft kosteneffizienter als Inference mit 70B.
Halluzinationen sind plausible, aber falsche Aussagen, die das Modell „erfindet". LLMs wissen nicht, was wahr ist – sie generieren statistisch wahrscheinlichen Text.
Gegenmaßnahmen:
- RAG: Externe Quellen abrufen und zitieren
- Grounding: Fakten aus strukturierten Datenbanken verwenden
- Self-Consistency: Mehrfach generieren und Mehrheitsantwort wählen
- Citation Enforcement: Modell zwingen, Quellen anzugeben
- Human-in-the-Loop: Kritische Ausgaben manuell prüfen
Ja! Mit Quantisierung und effizienten Inference-Engines laufen LLMs auf Consumer-Hardware:
- 7B Q4: ~4 GB VRAM → RTX 3060/4060, MacBook Air M1+
- 13B Q4: ~8 GB VRAM → RTX 3080/4070, MacBook Pro M1+
- 30B Q4: ~18 GB VRAM → RTX 4090, MacBook Pro M2 Max
- 70B Q4: ~40 GB VRAM → 2× RTX 4090, Mac Studio M2 Ultra
Tools: llama.cpp, ollama, LM Studio, vLLM, text-generation-webui
Fine-Tuning ändert die Modellgewichte – das Modell „lernt" neues Wissen oder Verhalten dauerhaft. Gut für: Stil, Format, Domänen-Vokabular, spezifische Aufgaben.
RAG ruft externes Wissen ab und fügt es in den Prompt ein – das Modellgewicht bleibt unverändert. Gut für: Aktuelle Informationen, Fakten, große Wissensbasen, Zitierbarkeit.
Kombination: Oft ist Fine-Tuning + RAG optimal – das Modell lernt das Format/Stil (Fine-Tuning) und erhält aktuelle Fakten (RAG).
Diese Frage ist philosophisch umstritten. Faktisch:
- LLMs sind statistische Mustererkenner – sie haben kein Weltmodell, kein Bewusstsein, keine Intentionalität
- Aber: Aus statistischen Mustern emergieren Fähigkeiten, die wie Reasoning, Planung und Kreativität aussehen
- Pragmatisch: Ob „echte" Intelligenz oder nicht, ist für Anwendungen irrelevant – die Funktionalität zählt
Wichtig: Behandeln Sie LLMs als Werkzeuge, nicht als Orakel. Immer kritisch prüfen, besonders bei faktischen Behauptungen.
Entscheidungshilfe basierend auf Anforderungen:
- Datenschutz / On-Premise: Llama 3, Qwen2.5, Mistral (Open-Weight)
- Maximale Leistung: GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro
- Kostenoptimiert: Llama-3-8B-Instruct, Qwen2.5-7B, Mistral-7B
- Coding: Claude 3.5 Sonnet, DeepSeek-V3, Qwen2.5-Coder
- Long Context: Gemini 1.5 Pro (2M), Claude 3.5 Sonnet (200K)
- Multilingual: Qwen2.5, BLOOM, mGPT
Tipp: Testen Sie immer mehrere Modelle mit Ihren konkreten Daten – Benchmarks sagen nicht alles voraus.
LLMs bringen neue Sicherheitsrisiken mit sich:
- Prompt Injection: Angreifer manipulieren die Eingabe, um das Modell zu schädlichem Verhalten zu bewegen.
- Data Leakage: Das Modell könnte vertrauliche Trainingsdaten preisgeben.
- Bias: Vorurteile in den Trainingsdaten werden vom Modell übernommen.
Sicherheit erfordert sorgfältiges Prompt-Design, Input-Validierung und Monitoring.
Zusammenfassung
Die wichtigsten Punkte
- LLMs sind Transformer-basierte neuronale Netze, die Next-Token-Prediction lernen
- Transformer: Self-Attention ermöglicht paralleles Training und lange Abhängigkeiten
- Tokenisierung: Text → Subword-Tokens → Embeddings → Modell
- Training: Pre-Training (Next-Token) → SFT (Instructions) → RLHF (Alignment)
- Fine-Tuning: LoRA/QLoRA für effiziente Anpassung an Domänen/Aufgaben
- Inference: Sampling-Strategien (Temperature, Top-k/p) steuern Output-Qualität
- Modelle: Open-Weight (Llama, Qwen, Mistral) vs. Proprietär (GPT-4, Claude, Gemini)
- Anwendungen: Chat, Code, Content, Analyse, Übersetzung, RAG
- Halluzinationen: Immer kritisch prüfen, RAG für Fakten verwenden
- Lokal betreiben: Mit Quantisierung auf Consumer-Hardware möglich
Nächste Schritte
Nach diesen Grundlagen empfehlen wir folgende Vertiefungen:
- Prompt Engineering: Systematische Prompt-Optimierung für bessere Ergebnisse
- RAG: Retrieval Augmented Generation für faktenbasierte Antworten
- KI-Agenten: Autonome Agenten mit Tool-Use und Planning
- MLOps: Produktionisierung von LLM-Anwendungen
- KI-Sicherheit: Red-Teaming, Guardrails, Evaluation
Weiterführende Themen
Systematische Prompt-Optimierung: Chain-of-Thought, Few-Shot, ReAct und mehr.
Zu Prompt EngineeringRetrieval Augmented Generation – externe Wissensquellen mit LLMs kombinieren.
Zu RAGAutonome Agenten mit Tool-Use, Planning und Memory für komplexe Workflows.
Zu KI-AgentenLLMs in Produktion: Deployment, Monitoring, Evaluation und CI/CD-Pipelines.
Zu MLOps