LLM Grundlagen

KAPITEL 16 · KI & ENGINEERING

LLM Grundlagen

Large Language Models verstehen – von der Transformer-Architektur über Tokenisierung und Training bis zu Fine-Tuning, Inference und praktischen Anwendungen. Ihr Fundament für KI-Engineering.

Transformer Tokenisierung Training Fine-Tuning Inference

Inhaltsverzeichnis

Schnellübersicht

Auf dieser Seite lernen Sie die wichtigsten Konzepte von Large Language Models:

  • Was sind LLMs? Definition und Grundprinzip
  • Transformer-Architektur: Self-Attention, Encoder/Decoder
  • Tokenisierung: Wie Text in Zahlen umgewandelt wird
  • Training: Pre-Training, Next-Token-Prediction
  • Fine-Tuning: Anpassung an spezifische Aufgaben
  • Inference: Wie LLMs Texte generieren
  • Modelle im Vergleich: GPT, Claude, Llama, Mistral
  • Anwendungsfälle: Chat, Code, Content, Analyse
  • FAQ: Häufige Fragen zu LLMs

1. Was sind Large Language Models?

Definition

Large Language Models (LLMs) sind neuronale Netze mit Milliarden von Parametern, die auf riesigen Textmengen trainiert wurden. Sie lernen statistische Muster in Sprache und können dadurch Text verstehen, generieren, übersetzen, zusammenfassen und viele weitere sprachliche Aufgaben bewältigen.

Das Grundprinzip ist überraschend einfach: LLMs sagen das nächste Wort (Token) in einer Sequenz voraus. Durch diese scheinbar simple Aufgabe emergieren komplexe Fähigkeiten wie Reasoning, Code-Generierung und kreatives Schreiben.

Wichtige Kennzahlen: Moderne LLMs haben 7–500+ Milliarden Parameter, wurden mit Billionen von Tokens trainiert und benötigen tausende GPUs für das Training.

Warum funktionieren LLMs so gut?

  • Skalierungsgesetze: Mehr Parameter + mehr Daten + mehr Compute = bessere Performance
  • Emergente Fähigkeiten: Ab bestimmten Größenordnungen entstehen neue Fähigkeiten (Reasoning, Few-Shot Learning)
  • Transfer Learning: Einmal trainiert, kann das Modell für viele Aufgaben angepasst werden
  • In-Context Learning: LLMs lernen aus Beispielen im Prompt, ohne Gewichte anzupassen

2. Die 6 Kernkonzepte von LLMs

Klicken Sie auf ein Konzept, um direkt zur detaillierten Erklärung zu gelangen.

01

Transformer

Die Architektur hinter allen modernen LLMs

Die Transformer-Architektur (2017) revolutionierte NLP. Self-Attention ermöglicht parallele Verarbeitung und das Erfassen langer Abhängigkeiten.

  • Self-Attention-Mechanismus
  • Multi-Head Attention
  • Positional Encoding
  • Feed-Forward Networks
02

Tokenisierung

Wie Text in Zahlen umgewandelt wird

LLMs verarbeiten keine Buchstaben, sondern Tokens. Tokenizer zerlegen Text in sinnvolle Einheiten (Subwords, Wörter, Zeichen).

  • Byte-Pair Encoding (BPE)
  • WordPiece, SentencePiece
  • Vokabular-Größe (32k–128k)
  • Special Tokens (BOS, EOS, PAD)
03

Training

Pre-Training mit Next-Token-Prediction

LLMs werden in zwei Phasen trainiert: Pre-Training auf riesigen Textkorpora, dann Fine-Tuning für spezifische Aufgaben.

  • Next-Token-Prediction
  • Masked Language Modeling
  • Skalierungsgesetze
  • Compute-Optimal Training
04

Fine-Tuning

Anpassung an spezifische Aufgaben

Nach dem Pre-Training werden LLMs durch Fine-Tuning an bestimmte Domänen oder Aufgaben angepasst – effizient und gezielt.

  • Supervised Fine-Tuning (SFT)
  • RLHF / RLAIF
  • LoRA / QLoRA
  • Instruction Tuning
05

Inference

Wie LLMs Texte generieren

Inference ist der Prozess der Textgenerierung. Sampling-Strategien steuern Kreativität vs. Determinismus.

  • Autoregressive Generierung
  • Temperature & Top-k/Top-p
  • KV-Cache Optimierung
  • Quantisierung (INT8, INT4)
06

Context Window

Wie viel Text ein Modell verarbeiten kann

Das Context Window definiert die maximale Anzahl Tokens, die ein LLM gleichzeitig verarbeiten kann – entscheidend für lange Dokumente.

  • 4K – 200K+ Tokens
  • RoPE & ALiBi Positional Encoding
  • Needle-in-a-Haystack Tests
  • Long-Context vs. RAG

3. Wie werden LLMs trainiert?

Das Training eines LLM ist ein mehrstufiger, ressourcenintensiver Prozess, der Monate dauern und Millionen von Dollar kosten kann.

Die 3 Phasen des LLM-Trainings

1
Pre-Training

Das Modell lernt allgemeine Sprachmuster aus Billionen von Texten (Internet, Bücher, Code). Es versucht, das nächste Wort vorherzusagen. Dies ist die teuerste Phase.

2
Supervised Fine-Tuning (SFT)

Das Modell wird mit hochwertigen Frage-Antwort-Paaren trainiert, um nützlicher und gesprächiger zu werden. Menschliche Trainer erstellen diese Datensätze.

3
RLHF

Reinforcement Learning from Human Feedback. Menschen bewerten Antworten, ein Reward-Modell lernt daraus und optimiert das LLM für menschliche Präferenzen (Hilfreichkeit, Ehrlichkeit, Harmlosigkeit).

Hardware-Anforderungen

Für das Training großer Modelle werden Clusters aus tausenden speziellen GPUs (NVIDIA A100/H100) oder TPUs benötigt. Der Speicherbedarf liegt oft im Terabyte-Bereich, und das Training verbraucht so viel Strom wie eine kleine Stadt.

4. Wichtige Konzepte & Begriffe

Um LLMs effektiv zu nutzen, sollten Sie diese technischen Begriffe verstehen.

Tokens & Embeddings

  • Token: Kleinste Einheit, die das Modell verarbeitet (Wortteil)
  • Embedding: Numerische Darstellung eines Tokens in einem hochdimensionalen Raum
  • Ähnliche Wörter haben ähnliche Embedding-Vektoren
  • Beispiel: "König" - "Mann" + "Frau" ≈ "Königin"

Context Window

  • Maximale Menge an Text, die das Modell gleichzeitig "sehen" kann
  • Gemessen in Tokens (z.B. 4k, 32k, 128k, 1M+)
  • Größeres Fenster = besserer Kontext, aber höherer Rechenaufwand
  • Alles außerhalb des Fensters wird "vergessen"

Halluzinationen

  • Wenn das Modell falsche Informationen als Fakten präsentiert
  • Entsteht, weil das Modell Wahrscheinlichkeiten, nicht Wahrheiten lernt
  • Kann durch RAG (Retrieval Augmented Generation) reduziert werden
  • Kritisches Problem für medizinische/juristische Anwendungen

Temperature & Parameter

  • Temperature: Steuert die Zufälligkeit der Ausgabe (0 = deterministisch, 1 = kreativ)
  • Top-P / Top-K: Begrenzt die Auswahl der nächsten Tokens
  • Fine-Tuning: Anpassen eines Basis-Modells auf spezifische Daten
  • Prompt Engineering: Optimieren der Eingabe für bessere Ergebnisse

5. Die Transformer-Architektur

Der Transformer (Vaswani et al., 2017) ist die Grundlage aller modernen LLMs. Er ersetzt rekurrente Netze durch Self-Attention und ermöglicht paralleles Training.

Transformer-Schichten im Überblick

Input Text

Roh-Text wird vom Tokenizer in Token-IDs umgewandelt

Embedding Layer

Token-IDs → dichte Vektoren (z.B. 4096 Dimensionen) + Positional Encoding

Multi-Head Self-Attention

Jedes Token attendiert auf alle anderen Tokens – erfasst Kontext und Abhängigkeiten

Feed-Forward Network

Nicht-lineare Transformation pro Token – speichert Wissen in den Gewichten

Output Head

Lineare Schicht + Softmax → Wahrscheinlichkeiten für nächstes Token

Warum Self-Attention so mächtig ist

  • Lange Abhängigkeiten: Jedes Token kann direkt auf jedes andere Token attendieren (keine sequentielle Verarbeitung)
  • Parallelisierbarkeit: Alle Tokens werden gleichzeitig verarbeitet → effizientes GPU-Training
  • Interpretierbarkeit: Attention-Weights zeigen, worauf das Modell „achtet"
  • Skalierbarkeit: Mehr Heads, mehr Layer, mehr Dimensionen → bessere Performance

6. Tokenisierung – Text in Zahlen

LLMs verstehen keinen Text direkt. Stattdessen wird Text in Tokens zerlegt – kleine Einheiten, die als Zahlen repräsentiert werden.

Wie Tokenizer funktionieren

Modern Tokenizer verwenden Subword-Algorithmen, die häufige Zeichenfolgen zu Tokens zusammenfassen:

  • BPE (Byte-Pair Encoding): GPT-Familie – beginnt mit Bytes, merged häufige Paare
  • WordPiece: BERT – maximiert Likelihood des Vokabulars
  • SentencePiece: Sprachunabhängig, arbeitet direkt auf UTF-8 Bytes
  • Unigram: T5 – probabilistisches Subword-Modell
Token-Beispiele

Ein Satz wird in Tokens zerlegt – nicht immer ganze Wörter:

"Unbelievable" → ["Un", "believ", "able"]
"ChatGPT" → ["Chat", "G", "PT"]
"🚀" → [2 bytes]
"Hello world" → ["Hello", " world"]

Faustregel: 1 Token ≈ 4 Zeichen (Englisch), ≈ 1,5 Zeichen (Deutsch)

Special Tokens

Tokenizer verwenden spezielle Kontroll-Tokens:

  • <BOS> – Begin of Sequence (Start)
  • <EOS> – End of Sequence (Ende)
  • <PAD> – Padding (Auffüllen)
  • <UNK> – Unknown (unbekanntes Token)
  • <SYSTEM> – System-Prompt Marker

7. Training – Wie LLMs lernen

Das Training von LLMs erfolgt in mehreren Phasen – von rohem Text zu einem hilfreichen Assistenten.

Phase 1: Pre-Training

Ziel: Next-Token-Prediction auf Billionen von Tokens aus dem Internet, Büchern, Code.

  • Datenmenge: 1–15 Billionen Tokens
  • Compute: Tausende GPUs über Monate
  • Kosten: $10M–$100M+
  • Ergebnis: Basis-Modell (Base Model) – kennt Sprache, aber folgt keinen Anweisungen
Phase 2: Supervised Fine-Tuning (SFT)

Ziel: Modell lernt, Anweisungen zu folgen – trainiert auf Frage-Antwort-Paaren.

  • Daten: 10K–500K hochwertige Beispiele
  • Format: Instruction → Response Paare
  • Ergebnis: Instruct-Modell – folgt Anweisungen, aber kann noch unsicher/unhilfreich sein
Phase 3: RLHF / RLAIF

Ziel: Modell wird hilfreich, ehrlich und harmlos – Alignment mit menschlichen Werten.

  • RLHF: Reinforcement Learning from Human Feedback
  • RLAIF: AI Feedback statt Human Feedback (skalierbarer)
  • DPO: Direct Preference Optimization (einfacher als RLHF)
  • Ergebnis: Chat-Modell – sicher, hilfreich, aligned

Skalierungsgesetze (Scaling Laws)

Die Performance von LLMs folgt vorhersagbaren Gesetzen (Kaplan et al., 2020; Chinchilla, 2022):

  • Loss ∝ N · D · C – Loss sinkt mit mehr Parametern (N), Daten (D) und Compute (C)
  • Chinchilla-Optimal: Für optimales Training sollten Parameter und Daten proportional skaliert werden
  • Emergent Abilities: Ab ~100B Parametern entstehen plötzlich neue Fähigkeiten (Chain-of-Thought, Few-Shot)

8. Fine-Tuning – Modelle anpassen

Fine-Tuning passt ein vortrainiertes LLM an spezifische Aufgaben, Domänen oder Formate an – deutlich günstiger als Training von Grund auf.

Full Fine-Tuning

Alle Parameter werden aktualisiert. Beste Qualität, aber teuer und speicherintensiv.

  • Benötigt volle GPU-Speicher für Modell + Optimizer States
  • Geeignet für: Große Datensätze, fundamentale Anpassungen
  • Kosten: Hoch (mehrere A100/H100)
LoRA / QLoRA

Low-Rank Adaptation: Nur kleine Adapter-Matrizen werden trainiert, Basis-Modell bleibt eingefroren.

  • LoRA: Trainiert Low-Rank-Matrizen (rank 8–64)
  • QLoRA: Kombiniert LoRA mit 4-Bit-Quantisierung → läuft auf Consumer-GPUs
  • Speicherbedarf: ~10-20% von Full Fine-Tuning
  • Geeignet für: Domänen-Anpassung, Format-Training
Instruction Tuning

Modell lernt, Anweisungen zu folgen – trainiert auf vielfältigen Task-Beschreibungen.

  • Datenformat: ### Instruction:\n...\n### Response:\n...
  • Diversität wichtig: Viele verschiedene Aufgabentypen
  • Qualität > Quantität: 10K hochwertige Beispiele > 100K mittelmäßige

9. Inference – Textgenerierung

Inference ist der Prozess, bei dem ein trainiertes LLM Text generiert. Understanding the sampling strategies is key to controlling output quality.

Sampling-Strategien

Wie wird das nächste Token ausgewählt?

  • Greedy: Immer das wahrscheinlichste Token → deterministisch, aber repetitiv
  • Temperature: Steuert Zufälligkeit (0.0 = greedy, 1.0 = normal, 2.0 = kreativ)
  • Top-k: Nur die k wahrscheinlichsten Tokens werden berücksichtigt
  • Top-p (Nucleus): Tokens werden ausgewählt, bis kumulative Wahrscheinlichkeit p erreicht
Performance-Optimierung

Inference ist oft der Flaschenhals – Optimierungen sind entscheidend:

  • KV-Cache: Speichert Key/Value-Paare → vermeidet Neuberechnung
  • Quantization: INT8/INT4 reduziert Speicherbedarf 2-4×
  • Speculative Decoding: Kleines Modell draftet, großes verifiziert
  • Batching: Mehrere Requests parallel verarbeiten
  • vLLM / TensorRT-LLM: Optimierte Inference-Engines

10. Beliebte LLMs im Vergleich

Übersicht der wichtigsten Open-Weight und proprietären Modelle (Stand 2026).

Modell Hersteller Parameter Context Lizenz Stärken
GPT-4o OpenAI ~1.8T (MoE) 128K Proprietär Allrounder, Multimodal
Claude 3.5 Sonnet Anthropic ~200B 200K Proprietär Coding, Analysis, Safety
Llama 3.1 405B Meta 405B 128K Llama License Open-Weight Leader, Fine-Tuning
Qwen2.5 72B Alibaba 72B 128K Apache 2.0 Multilingual, Coding, Math
Mistral Large 2 Mistral AI 123B 128K Mistral License Effizienz, European AI
Gemini 1.5 Pro Google ~1T (MoE) 2M Proprietär Longest Context, Multimodal
DeepSeek-V3 DeepSeek 671B (MoE) 128K MIT Coding, Reasoning, Open

Open-Weight vs. Proprietär

Open-Weight Modelle (Llama, Qwen, Mistral) bieten volle Kontrolle, Datenschutz und Anpassbarkeit. Proprietäre Modelle (GPT-4, Claude, Gemini) sind oft leistungsfähiger, aber weniger transparent und teurer im Betrieb. Für Enterprise-Anwendungen mit sensiblen Daten sind Open-Weight-Modelle mit lokalem Hosting oft die bessere Wahl.

11. Praktische Anwendungsfälle

LLMs werden in vielen Bereichen eingesetzt – hier die wichtigsten Kategorien.

Conversational AI

Chatbots, Customer Support, interne Assistenten. LLMs führen natürliche Gespräche und beantworten Fragen.

ChatGPT, Claude, Unternehmens-Chatbots

Code-Generierung

LLMs schreiben, erklären und debuggen Code. Copilots steigern Entwickler-Produktivität um 30-50%.

GitHub Copilot, Cursor, Cody, Tabnine

Content Creation

Texte verfassen, zusammenfassen, umschreiben. Marketing, Dokumentation, E-Mails.

Blog-Posts, Reports, Social Media, Übersetzungen

Datenanalyse

Strukturierte Daten analysieren, Insights extrahieren, SQL generieren, Reports erstellen.

CSV/Excel-Analyse, Datenbank-Queries, Trend-Erkennung

Übersetzung

Hochwertige Übersetzungen zwischen 100+ Sprachen. Kontextbewusst und domänenspezifisch.

Technische Docs, Rechtstexte, Lokalisierung

RAG (Retrieval Augmented)

LLMs + externe Wissensdatenbanken. Aktuelle, domänenspezifische Antworten ohne Halluzinationen.

Enterprise Search, Wissensmanagement, Compliance

12. FAQ – Häufige Fragen zu LLMs

Häufig gestellte Fragen

Verstehen LLMs wirklich, was sie sagen?

Nein, nicht im menschlichen Sinne. LLMs haben kein Bewusstsein oder Verständnis. Sie sind statistische Maschinen, die basierend auf Wahrscheinlichkeiten das nächste Wort vorhersagen. Durch die enorme Datenmenge und komplexe Architektur wirken die Antworten jedoch oft sehr intelligent und kontextbezogen. Man nennt dies "Emergent Abilities".

Was ist der Unterschied zwischen Parametern und Tokens?
  • Parameter: Die "Gewichte" im neuronalen Netz. Je mehr Parameter, desto komplexer und leistungsfähiger ist das Modell (z.B. GPT-3 hat 175 Milliarden Parameter).
  • Tokens: Die Einheiten, in die der Eingabe- und Ausgabetext zerlegt wird. Ein Token ist oft ein Wort oder ein Teil eines Wortes. Die Anzahl der Tokens bestimmt die Länge des Textes, den das Modell verarbeiten kann.
Warum halluzinieren LLMs?

LLMs sind darauf trainiert, plausible Texte zu generieren, nicht unbedingt faktisch korrekte. Wenn das Modell eine Frage nicht sicher beantworten kann, erfindet es oft eine Antwort, die sprachlich korrekt klingt, aber faktisch falsch ist. Dies liegt daran, dass das Modell keine echte Wissensdatenbank hat, sondern nur statistische Muster.

Lösung: Nutzung von RAG (Retrieval Augmented Generation), bei dem das Modell auf externe, verifizierte Quellen zugreift.

Kann ich ein LLM auf meinem eigenen PC betreiben?

Ja, aber es hängt von der Größe des Modells ab.

  • Kleine Modelle (7B Parameter): Laufen auf modernen Gaming-PCs mit 16-32 GB RAM (quantisiert).
  • Mittlere Modelle (13B-30B): Benötigen leistungsstarke GPUs mit viel VRAM (24GB+).
  • Große Modelle (70B+): Benötigen meist mehrere High-End-GPUs oder Server-Hardware.

Tools wie Ollama, LM Studio oder LocalAI machen das lokale Ausführen sehr einfach.

Was ist Quantisierung?

Quantisierung reduziert die Präzision der Zahlen, die die Parameter des Modells darstellen (z.B. von 16-Bit auf 4-Bit). Dies verringert den Speicherbedarf und die Rechenleistung erheblich, bei nur minimalem Verlust der Genauigkeit. Dadurch können große Modelle auf kleinerer Hardware laufen.

Was ist der Unterschied zwischen einem Base-Model und einem Instruct-Model?

Base-Modelle (z.B. Llama-3-70B-Base) sind nur mit Next-Token-Prediction trainiert. Sie vervollständigen Text, folgen aber keinen Anweisungen. Sie sind gut für Few-Shot-Learning und Forschung.

Instruct-/Chat-Modelle (z.B. Llama-3-70B-Instruct) wurden zusätzlich mit SFT und RLHF trainiert. Sie folgen Anweisungen, sind hilfsbereiter und sicherer. Für die meisten Anwendungen sollten Sie Instruct-Modelle verwenden.

Wie viele Parameter brauche ich für meine Anwendung?

Das hängt von der Aufgabe ab:

  • Einfache Klassifikation/Extraktion: 7B–13B reichen oft aus
  • Chat, Zusammenfassung: 30B–70B für gute Qualität
  • Komplexes Reasoning, Coding: 70B+ oder proprietäre Modelle
  • Domänenspezifisch: Kleineres Modell + Fine-Tuning kann besser sein als größeres Base-Modell

Tipp: Starten Sie klein und skalieren Sie nur, wenn nötig. Fine-Tuning eines 7B-Modells ist oft kosteneffizienter als Inference mit 70B.

Was sind Halluzinationen und wie vermeide ich sie?

Halluzinationen sind plausible, aber falsche Aussagen, die das Modell „erfindet". LLMs wissen nicht, was wahr ist – sie generieren statistisch wahrscheinlichen Text.

Gegenmaßnahmen:

  • RAG: Externe Quellen abrufen und zitieren
  • Grounding: Fakten aus strukturierten Datenbanken verwenden
  • Self-Consistency: Mehrfach generieren und Mehrheitsantwort wählen
  • Citation Enforcement: Modell zwingen, Quellen anzugeben
  • Human-in-the-Loop: Kritische Ausgaben manuell prüfen
Kann ich ein LLM lokal betreiben? Welche Hardware brauche ich?

Ja! Mit Quantisierung und effizienten Inference-Engines laufen LLMs auf Consumer-Hardware:

  • 7B Q4: ~4 GB VRAM → RTX 3060/4060, MacBook Air M1+
  • 13B Q4: ~8 GB VRAM → RTX 3080/4070, MacBook Pro M1+
  • 30B Q4: ~18 GB VRAM → RTX 4090, MacBook Pro M2 Max
  • 70B Q4: ~40 GB VRAM → 2× RTX 4090, Mac Studio M2 Ultra

Tools: llama.cpp, ollama, LM Studio, vLLM, text-generation-webui

Was ist der Unterschied zwischen Fine-Tuning und RAG?

Fine-Tuning ändert die Modellgewichte – das Modell „lernt" neues Wissen oder Verhalten dauerhaft. Gut für: Stil, Format, Domänen-Vokabular, spezifische Aufgaben.

RAG ruft externes Wissen ab und fügt es in den Prompt ein – das Modellgewicht bleibt unverändert. Gut für: Aktuelle Informationen, Fakten, große Wissensbasen, Zitierbarkeit.

Kombination: Oft ist Fine-Tuning + RAG optimal – das Modell lernt das Format/Stil (Fine-Tuning) und erhält aktuelle Fakten (RAG).

Sind LLMs wirklich „intelligent" oder nur Statistik?

Diese Frage ist philosophisch umstritten. Faktisch:

  • LLMs sind statistische Mustererkenner – sie haben kein Weltmodell, kein Bewusstsein, keine Intentionalität
  • Aber: Aus statistischen Mustern emergieren Fähigkeiten, die wie Reasoning, Planung und Kreativität aussehen
  • Pragmatisch: Ob „echte" Intelligenz oder nicht, ist für Anwendungen irrelevant – die Funktionalität zählt

Wichtig: Behandeln Sie LLMs als Werkzeuge, nicht als Orakel. Immer kritisch prüfen, besonders bei faktischen Behauptungen.

Welches LLM soll ich für mein Projekt wählen?

Entscheidungshilfe basierend auf Anforderungen:

  • Datenschutz / On-Premise: Llama 3, Qwen2.5, Mistral (Open-Weight)
  • Maximale Leistung: GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro
  • Kostenoptimiert: Llama-3-8B-Instruct, Qwen2.5-7B, Mistral-7B
  • Coding: Claude 3.5 Sonnet, DeepSeek-V3, Qwen2.5-Coder
  • Long Context: Gemini 1.5 Pro (2M), Claude 3.5 Sonnet (200K)
  • Multilingual: Qwen2.5, BLOOM, mGPT

Tipp: Testen Sie immer mehrere Modelle mit Ihren konkreten Daten – Benchmarks sagen nicht alles voraus.

Sind LLMs sicher?

LLMs bringen neue Sicherheitsrisiken mit sich:

  • Prompt Injection: Angreifer manipulieren die Eingabe, um das Modell zu schädlichem Verhalten zu bewegen.
  • Data Leakage: Das Modell könnte vertrauliche Trainingsdaten preisgeben.
  • Bias: Vorurteile in den Trainingsdaten werden vom Modell übernommen.

Sicherheit erfordert sorgfältiges Prompt-Design, Input-Validierung und Monitoring.

Zusammenfassung

Die wichtigsten Punkte

  • LLMs sind Transformer-basierte neuronale Netze, die Next-Token-Prediction lernen
  • Transformer: Self-Attention ermöglicht paralleles Training und lange Abhängigkeiten
  • Tokenisierung: Text → Subword-Tokens → Embeddings → Modell
  • Training: Pre-Training (Next-Token) → SFT (Instructions) → RLHF (Alignment)
  • Fine-Tuning: LoRA/QLoRA für effiziente Anpassung an Domänen/Aufgaben
  • Inference: Sampling-Strategien (Temperature, Top-k/p) steuern Output-Qualität
  • Modelle: Open-Weight (Llama, Qwen, Mistral) vs. Proprietär (GPT-4, Claude, Gemini)
  • Anwendungen: Chat, Code, Content, Analyse, Übersetzung, RAG
  • Halluzinationen: Immer kritisch prüfen, RAG für Fakten verwenden
  • Lokal betreiben: Mit Quantisierung auf Consumer-Hardware möglich

Nächste Schritte

Nach diesen Grundlagen empfehlen wir folgende Vertiefungen:

  • Prompt Engineering: Systematische Prompt-Optimierung für bessere Ergebnisse
  • RAG: Retrieval Augmented Generation für faktenbasierte Antworten
  • KI-Agenten: Autonome Agenten mit Tool-Use und Planning
  • MLOps: Produktionisierung von LLM-Anwendungen
  • KI-Sicherheit: Red-Teaming, Guardrails, Evaluation
Weiter zu Prompt Engineering

Weiterführende Themen

Prompt Engineering

Systematische Prompt-Optimierung: Chain-of-Thought, Few-Shot, ReAct und mehr.

Zu Prompt Engineering
RAG

Retrieval Augmented Generation – externe Wissensquellen mit LLMs kombinieren.

Zu RAG
KI-Agenten

Autonome Agenten mit Tool-Use, Planning und Memory für komplexe Workflows.

Zu KI-Agenten
MLOps

LLMs in Produktion: Deployment, Monitoring, Evaluation und CI/CD-Pipelines.

Zu MLOps