Unicode Normalizer

Normalisieren Sie Unicode-Text für konsistente Darstellung und Verarbeitung

Unicode Normalizer

Konvertieren Sie Unicode-Text in verschiedene Normalisierungsformen (NFC, NFD, NFKC, NFKD)

Was ist Unicode-Normalisierung?

Unicode-Normalisierung ist der Prozess, Zeichen in eine standardisierte Form zu bringen. Viele Zeichen können auf unterschiedliche Weise dargestellt werden (z.B. 'é' als ein Zeichen U+00E9 oder als Kombination von 'e' + Akzent U+0065 U+0301).

Normalisierungsformen
  • NFCCanonical Composition: Kombiniert Zeichen wo möglich (é → é)
  • NFDCanonical Decomposition: Zerlegt Zeichen (é → e + ́)
  • NFKCCompatibility Composition: Wie NFC, aber ersetzt Kompatibilitätszeichen
  • NFKDCompatibility Decomposition: Wie NFD, aber ersetzt Kompatibilitätszeichen
Anwendungen
  • Textvergleich: "Café" = "Café" unabhängig von der Kodierung
  • Datenbanken: Konsistente Speicherung
  • Sortierung: Korrekte Reihenfolge
  • Suchfunktionen: Finden von Texten trotz unterschiedlicher Kodierung

Kompatibilitätszeichen sind Zeichen, die aus Kompatibilitätsgründen existieren, aber in modernen Schriftarten durch andere Zeichen ersetzt werden können (z.B. fi als Ligatur vs. f + i).

Beispiele

Akzente
Ligaturen
Emoji
Familie
Deutsch

1. Text eingeben

2. Normalisierter Text

Normalisiert
NFC (Normalization Form C)

Statistiken

Länge (Zeichen)
42
Code Points
45
Bytes (UTF-8)
87

Code-Point-Analyse

Zeichen Code Point UTF-8 Hex Name

Über Unicode-Normalisierung

Die Unicode-Normalisierung stellt sicher, dass äquivalente Zeichenfolgen in einer einheitlichen Darstellung vorliegen – wichtig für Textvergleich, Sortierung und Datenbankabfragen.

Normalisierungsformen
  • NFC – Zusammengesetzt (Canonical Composition)
  • NFD – Zerlegt (Canonical Decomposition)
  • NFKC – Kompatibilität + Zusammensetzung
  • NFKD – Kompatibilität + Zerlegung
Beispiel: "Ä" (A-Umlaut)
  • NFC: Ä (ein Zeichen, U+00C4)
  • NFD: A + ¨ (zwei Zeichen, U+0041 + U+0308)

Hinweis: Die Normalisierung ist besonders wichtig für Suchfunktionen, Textvergleiche und Datenbank-Indizes.