\d · \w · \s ·
POSIX-Klassen ·
Unicode-Kategorien ·
negierte Klassen ·
Bereichsangaben
Zeichenklassen definieren Mengen von Zeichen, die an einer Position matchen können. Sie sind das Herzstück jeder präzisen Regex und ermöglichen sowohl einfache als auch komplexe Suchmuster.
Shorthand Classes sind die am häufigsten verwendeten Zeichenklassen. Sie bieten eine kompakte Schreibweise für die gängigsten Zeichengruppen.
re.ASCII) ist \w auf ASCII beschränkt. Für Unicode-Unterstützung verwenden Sie \p{L} oder die POSIX-Klasse [[:word:]].
POSIX-Klassen sind in vielen Regex-Engines verfügbar (insbesondere in grep, sed, awk und in C/C++-Bibliotheken). Sie werden innerhalb von [] mit doppelten eckigen Klammern geschrieben.
Unicode-Kategorien ermöglichen den Zugriff auf alle Zeichen des Unicode-Standards – von Buchstaben und Ziffern über Satzzeichen bis zu mathematischen Symbolen.
\p{...} ist nicht in allen Regex-Engines verfügbar. In JavaScript benötigen Sie das u-Flag, in Python regex-Modul (nicht re) oder re.UNICODE.
Negierte Klassen matchen alle Zeichen, die nicht in der angegebenen Menge enthalten sind. Sie werden mit ^ am Anfang der Klasse definiert.
Bereichsangaben ermöglichen die Definition von Zeichenbereichen mit -. Sie sind die Grundlage für alle benutzerdefinierten Zeichenklassen.
-) hat in Zeichenklassen eine Sonderbedeutung. Um ihn als Literal zu verwenden, setzen Sie ihn an den Anfang ([-]) oder an das Ende ([a-z-]) der Klasse.
Praxisbeispiele zeigen die Anwendung von Zeichenklassen in realen Szenarien – von der Validierung von Eingaben bis zur Extraktion von Informationen.
\d
[:digit:]
\p{N}
[^...]
[a-z]
[\w.-]+
[\w.-]+@[\w.-]+\.\w+ ·
\d{4}-\d{2}-\d{2} ·
[^<>]+