Unicode Normalizer
Normalisieren Sie Unicode-Text für konsistente Darstellung und Verarbeitung
Unicode Normalizer
Konvertieren Sie Unicode-Text in verschiedene Normalisierungsformen (NFC, NFD, NFKC, NFKD)
Was ist Unicode-Normalisierung?
Unicode-Normalisierung ist der Prozess, Zeichen in eine standardisierte Form zu bringen. Viele Zeichen können auf unterschiedliche Weise dargestellt werden (z.B. 'é' als ein Zeichen U+00E9 oder als Kombination von 'e' + Akzent U+0065 U+0301).
Normalisierungsformen
- NFC – Canonical Composition: Kombiniert Zeichen wo möglich (é → é)
- NFD – Canonical Decomposition: Zerlegt Zeichen (é → e + ́)
- NFKC – Compatibility Composition: Wie NFC, aber ersetzt Kompatibilitätszeichen
- NFKD – Compatibility Decomposition: Wie NFD, aber ersetzt Kompatibilitätszeichen
Anwendungen
- Textvergleich: "Café" = "Café" unabhängig von der Kodierung
- Datenbanken: Konsistente Speicherung
- Sortierung: Korrekte Reihenfolge
- Suchfunktionen: Finden von Texten trotz unterschiedlicher Kodierung
Kompatibilitätszeichen sind Zeichen, die aus Kompatibilitätsgründen existieren, aber in modernen Schriftarten durch andere Zeichen ersetzt werden können (z.B. fi als Ligatur vs. f + i).
Beispiele
1. Text eingeben
2. Normalisierter Text
Statistiken
Code-Point-Analyse
| Zeichen | Code Point | UTF-8 Hex | Name |
|---|
Über Unicode-Normalisierung
Die Unicode-Normalisierung stellt sicher, dass äquivalente Zeichenfolgen in einer einheitlichen Darstellung vorliegen – wichtig für Textvergleich, Sortierung und Datenbankabfragen.
Normalisierungsformen
- NFC – Zusammengesetzt (Canonical Composition)
- NFD – Zerlegt (Canonical Decomposition)
- NFKC – Kompatibilität + Zusammensetzung
- NFKD – Kompatibilität + Zerlegung
Beispiel: "Ä" (A-Umlaut)
- NFC: Ä (ein Zeichen, U+00C4)
- NFD: A + ¨ (zwei Zeichen, U+0041 + U+0308)
Hinweis: Die Normalisierung ist besonders wichtig für Suchfunktionen, Textvergleiche und Datenbank-Indizes.