Monitoring & Logging
Monitoring & Logging
Die Augen und Ohren Ihrer IT-Infrastruktur – von Metriken und Logs über Alerting bis zu SIEM. Tools wie Prometheus, Grafana, Zabbix, ELK-Stack und Best Practices für Enterprise-Monitoring.
Inhaltsverzeichnis
Schnellübersicht
Auf dieser Seite lernst du alles über Monitoring & Logging:
- Definition: Was ist Monitoring und Logging?
- Warum wichtig: Business-Impact und Kosten
- Metriken & KPIs: Die wichtigsten Kennzahlen
- Monitoring-Tools: Prometheus, Grafana, Zabbix, PRTG, Datadog
- Logging: ELK-Stack, Splunk, Graylog
- Alerting: Levels, Eskalation, On-Call
- SIEM: Security Information & Event Management
- Best Practices: Für erfolgreiches Monitoring
- FAQ: Häufige Fragen
1. Was ist Monitoring & Logging?
Definition
Monitoring ist die kontinuierliche Überwachung von IT-Systemen, Anwendungen und Infrastrukturen, um deren Zustand, Performance und Verfügbarkeit zu erfassen. Es sammelt Metriken (CPU, RAM, Netzwerk), Events und Logs, um Probleme frühzeitig zu erkennen.
Logging ist die Aufzeichnung von Ereignissen (Events) in Systemen und Anwendungen. Logs enthalten detaillierte Informationen über Aktionen, Fehler, Zugriffe und Zustandsänderungen – essenziell für Troubleshooting, Audit und Compliance.
Zusammen bilden Monitoring und Logging das zentrale Nervensystem jeder IT-Infrastruktur. Ohne sie betreibt man IT "blind" – Probleme werden erst entdeckt, wenn Benutzer sich beschweren.
Einfache Analogie
Auto-Analogie
Stell dir dein Auto vor:
- Tacho & Drehzahlmesser (Monitoring): Zeigen aktuelle Werte (Geschwindigkeit, RPM)
- Warnlampen (Alerting): Melden Probleme (Öldruck, Temperatur)
- Werkstatt-Diagnose (Logging): Detaillierte Fehlercodes für Mechaniker
- Fahrtenschreiber (Audit): Aufzeichnung aller Fahrten für Compliance
Ohne diese Instrumente würdest du blind fahren – genau wie IT ohne Monitoring.
2. Warum ist Monitoring wichtig?
Die Auswirkungen von IT-Ausfällen sind enorm. Hier die wichtigsten Gründe für professionelles Monitoring:
Die 5 Hauptgründe für Monitoring
- Früherkennung: Probleme erkennen, bevor Benutzer sie bemerken
- Schnellere Lösung: MTTR reduzieren durch detaillierte Daten
- Kosteneinsparung: Ausfallkosten vermeiden (5.600 €/min bei Enterprise)
- Compliance: Audit-Trails für DSGVO, ISO 27001, SOX
- Capacity Planning: Trends erkennen, Ressourcen planen
ROI von Monitoring
Ein typisches Unternehmen mit 500 Servern und 10.000 Usern:
- Monitoring-Kosten: ~2.000-5.000 €/Monat
- Einsparung durch vermiedene Ausfälle: ~50.000-200.000 €/Jahr
- ROI: 10-40× in den ersten 12 Monaten
3. Metriken & KPIs – Die wichtigsten Kennzahlen
Metriken sind messbare Werte, die den Zustand von Systemen beschreiben. Hier die wichtigsten Kategorien:
Infrastruktur-Metriken
-
CPU-AuslastungProzessor-Last in %
-
RAM-UsageArbeitsspeicher in %
-
Disk I/OLese-/Schreib-Operationen
-
Netzwerk-TrafficBandbreite in Mbps
-
TemperaturHardware-Temperatur in °C
Application-Metriken
-
Response TimeAntwortzeit in ms
-
Request RateAnfragen pro Sekunde
-
Error RateFehlerquote in %
-
ThroughputTransaktionen/Sekunde
-
Apdex ScoreUser Satisfaction (0-1)
Business-Metriken
-
UptimeVerfügbarkeit in %
-
MTBFMean Time Between Failures
-
MTTRMean Time to Repair
-
SLA ComplianceSLA-Einhaltung in %
-
User SessionsAktive Benutzer
Security-Metriken
-
Failed LoginsFehlgeschlagene Anmeldungen
-
Firewall EventsBlockierte Verbindungen
-
Malware DetectionsErkannte Bedrohungen
-
VulnerabilitiesOffene Schwachstellen
-
Compliance ScoreRegelkonformität in %
Die 4 Goldenen Signale (Google SRE)
Google empfiehlt, jedes System anhand von 4 Signalen zu überwachen:
- Latency: Wie lange dauert eine Anfrage?
- Traffic: Wie viele Anfragen pro Sekunde?
- Errors: Wie viele Anfragen schlagen fehl?
- Saturation: Wie ausgelastet sind die Ressourcen?
4. Monitoring-Tools im Überblick
Die wichtigsten Monitoring-Tools für Enterprise-Umgebungen – von Open Source bis Commercial:
Prometheus
Das führende Open-Source-Monitoring-System für Cloud-native Umgebungen. Pull-basiert, Time-Series-Datenbank.
- PromQL (mächtige Abfragesprache)
- Service Discovery (Kubernetes, AWS)
- Alertmanager für Alerting
- CNCF Graduated Project
Grafana
Die führende Plattform für Datenvisualisierung. Unterstützt 50+ Datenquellen (Prometheus, InfluxDB, Elasticsearch, SQL).
- Interaktive Dashboards
- 50+ Datenquellen
- Alerting & Annotations
- Grafana Cloud verfügbar
Zabbix
Umfassende Enterprise-Monitoring-Lösung. Push- und Pull-basiert, ideal für traditionelle IT-Infrastrukturen.
- Agent-basiert & agentenlos
- Auto-Discovery
- Distributed Monitoring
- Web-Interface & Mobile
PRTG Network Monitor
Deutsche All-in-One-Lösung von Paessler. Einfach zu bedienen, stark in Netzwerk-Monitoring.
- SNMP, WMI, Packet Sniffing
- 200+ Sensoren vordefiniert
- Map-Visualisierung
- Deutsche Dokumentation
Datadog
Führende Cloud-Monitoring-Plattform. 500+ Integrationen, APM, Logs, Synthetics, Security in einer Plattform.
- APM & Distributed Tracing
- Log Management
- Synthetics Monitoring
- AI-basierte Anomalie-Erkennung
Nagios
Der Urvater des IT-Monitoring. Seit 1999 im Einsatz, riesige Community, tausende Plugins.
- 5.000+ Plugins
- Push & Pull Monitoring
- Nagios XI (Commercial)
- Große Community
Splunk
Führende Plattform für Log-Analyse und SIEM. Mächtige Suchsprache (SPL), Enterprise-Security.
- SPL (Search Processing Language)
- SIEM & Security Analytics
- IT Service Intelligence (ITSI)
- 1.000+ Apps & Add-ons
ELK Stack
Der De-facto-Standard für Log-Management. Open Source, mächtige Suchfunktionen, flexible Visualisierung.
- Full-Text Search
- Real-time Analytics
- Machine Learning
- Elastic Cloud verfügbar
SolarWinds
Umfassende Enterprise-IT-Management-Suite. Network Performance Monitor, Server & Application Monitor.
- Network Performance Monitor
- Server & Application Monitor
- Database Performance Analyzer
- 200+ Produkte
| Tool | Typ | Open Source | Cloud | On-Premise | Preis |
|---|---|---|---|---|---|
| Prometheus | Time Series | Gratis | |||
| Grafana | Visualisierung | Gratis/Cloud | |||
| Zabbix | Enterprise Suite | Gratis | |||
| PRTG | Network Monitor | Ab 1.600 € | |||
| Datadog | Cloud Platform | Ab 15 €/Host | |||
| Nagios | Classic Monitor | Gratis/Commercial | |||
| Splunk | SIEM/Logs | Ab 2.000 €/Monat | |||
| ELK Stack | Log Management | Gratis/Cloud | |||
| SolarWinds | IT Management | Ab 3.000 € |
5. Logging & ELK-Stack
Logs sind das Gedächtnis Ihrer IT-Infrastruktur. Der ELK-Stack ist der De-facto-Standard für Log-Management:
ELK-Stack Architektur
Beats
Datensammler
Logstash
Verarbeitung & Parsing
Elasticsearch
Speicherung & Suche
Kibana
Visualisierung
Beispiel: Prometheus Konfiguration
Beispiel: Alerting Rules
Log-Level verstehen
- DEBUG: Detaillierte Debug-Informationen (nur Entwicklung)
- INFO: Normale Betriebsinformationen
- WARN: Potentielle Probleme, aber kein Fehler
- ERROR: Fehler, die behoben werden müssen
- FATAL/CRITICAL: Kritische Fehler, System kann nicht weiterlaufen
6. Alerting & Eskalation
Alerting ist das Herzstück proaktiven Monitorings. Richtige Alert-Levels und Eskalationspfade sind entscheidend:
Critical
P1 · SofortSystemausfall, Datenverlust, Sicherheitsverletzung. Sofortige Reaktion erforderlich.
High
P2 · 15 MinSchwere Performance-Probleme, teilweise Ausfälle. Dringende Reaktion nötig.
Medium
P3 · 1 StdModerate Probleme, degraded performance. Reaktion innerhalb einer Stunde.
Low
P4 · 1 TagInformationelle Alerts, keine unmittelbare Auswirkung. Nächster Arbeitstag.
Alerting Best Practices
- Alert Fatigue vermeiden: Nur actionable Alerts (max. 5-10/Tag pro Engineer)
- Runbooks verlinken: Jeder Alert sollte ein Runbook mit Lösungsschritten haben
- Multi-Channel Alerting: Email, Slack, SMS, PagerDuty je nach Severity
- Escalation Policies: Klare Eskalationspfade definieren
- Alert Tuning: Regelmäßig Alerts evaluieren und anpassen
- Silencing: Wartungsfenster für geplante Downtimes nutzen
7. SIEM – Security Information & Event Management
SIEM kombiniert Log-Management mit Security-Analytics für Bedrohungserkennung und Incident Response:
Zentrale Sammlung aller Security-relevanten Logs aus:
- Firewalls & IDS/IPS
- Authentication Systems (AD, LDAP)
- Endpoint Protection
- Applications & Databases
- Cloud Services (AWS CloudTrail, Azure Monitor)
Intelligente Korrelation von Events zur Erkennung von:
- Brute-Force-Angriffen
- Laterale Bewegung im Netzwerk
- Data Exfiltration
- Insider Threats
- Malware-Infektionen
Automatisierte Alerts und Response-Aktionen:
- Echtzeit-Alerts bei Bedrohungen
- Automatische Blockierung (Firewall Rules)
- Incident-Ticket-Erstellung
- SOAR-Integration (Security Orchestration)
- Forensische Untersuchungen
Unterstützung für Compliance-Anforderungen:
- DSGVO (Datenverarbeitung protokollieren)
- ISO 27001 (Security Monitoring)
- SOX (Finanz-Transaktionen)
- HIPAA (Gesundheitsdaten)
- PCI DSS (Zahlungsverkehr)
Führende SIEM-Lösungen
- Splunk: Marktführer, mächtige SPL-Suchsprache
- Microsoft Sentinel: Cloud-native SIEM in Azure
- IBM QRadar: Enterprise SIEM mit AI
- Elastic Security: Open Source SIEM (ELK-basiert)
- Wazuh: Open Source SIEM & XDR
- ArcSight (Micro Focus): Klassisches Enterprise SIEM
8. Best Practices für Monitoring
Die wichtigsten Empfehlungen für erfolgreiches Monitoring & Logging:
Metriken-Strategie
- USE-Methode (Utilization, Saturation, Errors)
- RED-Methode (Rate, Errors, Duration)
- 4 Golden Signals (Google SRE)
- Business-Metriken definieren
- Baseline erstellen (Normalzustand)
Alerting-Strategie
- Alert Fatigue vermeiden
- Severity-Levels definieren
- Runbooks für jeden Alert
- Multi-Channel Notification
- Regelmäßiges Alert-Tuning
Logging-Strategie
- Strukturierte Logs (JSON)
- Zentrale Log-Aggregation
- Log-Retention definieren
- Sensible Daten maskieren
- Log-Level konsistent nutzen
Dashboard-Design
- Role-based Dashboards
- Golden Signals prominent
- Drill-down ermöglichen
- Mobile-friendly gestalten
- TV-Displays im NOC
Automatisierung
- Infrastructure as Code (IaC)
- Auto-Scaling basierend auf Metriken
- Self-healing Systems
- Automated Remediation
- CI/CD für Monitoring-Configs
Security Monitoring
- SIEM implementieren
- Threat Intelligence integrieren
- Anomaly Detection (ML)
- Incident Response Plan
- Regelmäßige Security Audits
Goldene Regeln für Monitoring
- Monitor what matters: Nicht alles überwachen, nur Business-kritische Metriken
- Start simple: Mit Basis-Monitoring beginnen, dann erweitern
- Automate everything: Monitoring-Config als Code versionieren
- Test your alerts: Regelmäßig Alert-Wege testen (Chaos Engineering)
- Document runbooks: Für jeden kritischen Alert ein Runbook
- Review & iterate: Monitoring ist nie "fertig" – kontinuierlich verbessern
9. FAQ – Häufige Fragen
Häufige Fragen zu Monitoring & Logging
Monitoring zeigt dir, ob etwas kaputt ist (bekannte Probleme). Observability hilft dir zu verstehen, warum etwas kaputt ist (unbekannte Probleme).
Observability basiert auf 3 Säulen: Metrics, Logs und Traces. Sie ermöglicht es, durch komplexe Systeme zu "sehen" und Root Causes zu finden, ohne vorher bekannte Fragen stellen zu müssen.
So viel wie nötig, so wenig wie möglich. Richtwerte:
- Produktion: INFO und höher (WARN, ERROR, FATAL)
- Staging: DEBUG und höher
- Entwicklung: Alle Log-Levels
Wichtig: Log-Retention definieren (z.B. 30 Tage hot, 1 Jahr cold, 7 Jahre Compliance).
Die Kosten variieren stark je nach Größe und Anforderungen:
- Small Business (10-50 Server): 200-1.000 €/Monat
- Mid-Market (50-500 Server): 1.000-10.000 €/Monat
- Enterprise (500+ Server): 10.000-100.000+ €/Monat
Open-Source-Lösungen (Prometheus, Grafana, ELK) sind kostenlos, aber erfordern Betriebsaufwand.
Alert Fatigue ist eines der größten Probleme im Monitoring. Strategien dagegen:
- Alert nur bei actionable Problemen: Wenn kein Engineer etwas tun kann, kein Alert
- Thresholds richtig setzen: Nicht zu sensibel
- Alert grouping: Zusammenhängende Alerts gruppieren
- Regelmäßiges Tuning: Alerts quarterly evaluieren
- Max. 5-10 Alerts/Tag pro Engineer: Als Richtwert
Distributed Tracing verfolgt Anfragen durch verteilte Systeme (Microservices). Es zeigt:
- Welche Services eine Anfrage durchläuft
- Wie lange jeder Schritt dauert
- Wo Engpässe oder Fehler auftreten
Tools: Jaeger, Zipkin, AWS X-Ray, Datadog APM. Wichtig für Microservice-Architekturen.
Log-Retention hängt von Anforderungen ab:
- Hot Storage (schnelle Suche): 7-30 Tage
- Warm Storage (gelegentliche Suche): 30-90 Tage
- Cold Storage (Archiv): 1-7 Jahre
- Compliance (DSGVO, SOX): Bis 10 Jahre
Tipp: Tiered Storage nutzen – alte Logs automatisch archivieren.
APM überwacht die Performance von Anwendungen aus Benutzersicht:
- Response Times
- Error Rates
- Throughput
- Database Queries
- External API Calls
Tools: Dynatrace, New Relic, AppDynamics, Datadog APM, Elastic APM.
Empfohlener Start für kleine Unternehmen:
- Phase 1 (Woche 1-2): Basis-Monitoring mit PRTG (gratis bis 100 Sensoren) oder Uptime Kuma
- Phase 2 (Monat 1-2): Prometheus + Grafana für Server-Metriken
- Phase 3 (Monat 3-6): ELK Stack für Log-Management
- Phase 4 (Monat 6+): Alerting, Dashboards, Runbooks
Wichtig: Nicht alles auf einmal – inkrementell aufbauen.
Zusammenfassung
Die wichtigsten Punkte
- Monitoring: Kontinuierliche Überwachung von IT-Systemen und Anwendungen
- Logging: Aufzeichnung von Events für Troubleshooting und Compliance
- Metriken: Infrastruktur (CPU, RAM), Application (Response Time, Error Rate), Business (Uptime, MTTR)
- Tools: Prometheus, Grafana, Zabbix, PRTG, Datadog, Nagios, Splunk, ELK
- ELK-Stack: Elasticsearch + Logstash + Kibana (+ Beats) für Log-Management
- Alerting: 4 Levels (Critical, High, Medium, Low) mit Eskalationspfaden
- SIEM: Security Information & Event Management für Bedrohungserkennung
- Best Practices: USE/RED-Methoden, 4 Golden Signals, Alert Fatigue vermeiden
- ROI: 10-40× durch vermiedene Ausfälle und schnellere Lösung
- Trend: Observability (Metrics + Logs + Traces), AI-basierte Anomalie-Erkennung
Nächste Schritte
Bereit, Monitoring in Ihrer Organisation aufzubauen? Hier ein empfohlener Weg:
- Assessment: Aktuelle Infrastruktur analysieren (Server, Anwendungen, Netzwerke)
- Use Cases definieren: Was soll überwacht werden? (Verfügbarkeit, Performance, Security)
- Tool-Auswahl: Open Source (Prometheus/Grafana) oder Commercial (Datadog/PRTG)?
- PoC durchführen: 2-4 Wochen Test mit 5-10 Servern
- Phasenweiser Rollout: Basis → Erweitert → Advanced → SIEM
- Continuous Improvement: Monitoring ist nie "fertig" – kontinuierlich verbessern
Weiterführende Themen
Server-Architekturen, Virtualisierung und Client-Management im Detail.
Zu Server & ClientsSecurity-Grundlagen, Kryptographie, Netzwerksicherheit und Compliance.
Zur IT-SicherheitIaaS, PaaS, SaaS, Azure, AWS – Cloud-Infrastruktur verstehen.
Zu Cloud ComputingTCP/IP, Subnetting, Routing – Netzwerke für Monitoring verstehen.
Zu Netzwerk-Grundlagen