Monitoring & Logging

KAPITEL 10 · ENTERPRISE IT

Monitoring & Logging

Die Augen und Ohren Ihrer IT-Infrastruktur – von Metriken und Logs über Alerting bis zu SIEM. Tools wie Prometheus, Grafana, Zabbix, ELK-Stack und Best Practices für Enterprise-Monitoring.

Metriken Logging Alerting Tools SIEM

Inhaltsverzeichnis

Schnellübersicht

Auf dieser Seite lernst du alles über Monitoring & Logging:

  • Definition: Was ist Monitoring und Logging?
  • Warum wichtig: Business-Impact und Kosten
  • Metriken & KPIs: Die wichtigsten Kennzahlen
  • Monitoring-Tools: Prometheus, Grafana, Zabbix, PRTG, Datadog
  • Logging: ELK-Stack, Splunk, Graylog
  • Alerting: Levels, Eskalation, On-Call
  • SIEM: Security Information & Event Management
  • Best Practices: Für erfolgreiches Monitoring
  • FAQ: Häufige Fragen

1. Was ist Monitoring & Logging?

Definition

Monitoring ist die kontinuierliche Überwachung von IT-Systemen, Anwendungen und Infrastrukturen, um deren Zustand, Performance und Verfügbarkeit zu erfassen. Es sammelt Metriken (CPU, RAM, Netzwerk), Events und Logs, um Probleme frühzeitig zu erkennen.

Logging ist die Aufzeichnung von Ereignissen (Events) in Systemen und Anwendungen. Logs enthalten detaillierte Informationen über Aktionen, Fehler, Zugriffe und Zustandsänderungen – essenziell für Troubleshooting, Audit und Compliance.

Zusammen bilden Monitoring und Logging das zentrale Nervensystem jeder IT-Infrastruktur. Ohne sie betreibt man IT "blind" – Probleme werden erst entdeckt, wenn Benutzer sich beschweren.

Einfache Analogie

Auto-Analogie

Stell dir dein Auto vor:

  • Tacho & Drehzahlmesser (Monitoring): Zeigen aktuelle Werte (Geschwindigkeit, RPM)
  • Warnlampen (Alerting): Melden Probleme (Öldruck, Temperatur)
  • Werkstatt-Diagnose (Logging): Detaillierte Fehlercodes für Mechaniker
  • Fahrtenschreiber (Audit): Aufzeichnung aller Fahrten für Compliance

Ohne diese Instrumente würdest du blind fahren – genau wie IT ohne Monitoring.

2. Warum ist Monitoring wichtig?

Die Auswirkungen von IT-Ausfällen sind enorm. Hier die wichtigsten Gründe für professionelles Monitoring:

99,9%
Ziel-Verfügbarkeit (SLA)
< 15 min
MTTR (Mean Time to Repair)
80%
Probleme proaktiv erkannt
5.600 €/min
Durchschnittliche Ausfallkosten

Die 5 Hauptgründe für Monitoring

  1. Früherkennung: Probleme erkennen, bevor Benutzer sie bemerken
  2. Schnellere Lösung: MTTR reduzieren durch detaillierte Daten
  3. Kosteneinsparung: Ausfallkosten vermeiden (5.600 €/min bei Enterprise)
  4. Compliance: Audit-Trails für DSGVO, ISO 27001, SOX
  5. Capacity Planning: Trends erkennen, Ressourcen planen

ROI von Monitoring

Ein typisches Unternehmen mit 500 Servern und 10.000 Usern:

  • Monitoring-Kosten: ~2.000-5.000 €/Monat
  • Einsparung durch vermiedene Ausfälle: ~50.000-200.000 €/Jahr
  • ROI: 10-40× in den ersten 12 Monaten

3. Metriken & KPIs – Die wichtigsten Kennzahlen

Metriken sind messbare Werte, die den Zustand von Systemen beschreiben. Hier die wichtigsten Kategorien:

Infrastruktur-Metriken

  • CPU-Auslastung
    Prozessor-Last in %
  • RAM-Usage
    Arbeitsspeicher in %
  • Disk I/O
    Lese-/Schreib-Operationen
  • Netzwerk-Traffic
    Bandbreite in Mbps
  • Temperatur
    Hardware-Temperatur in °C

Application-Metriken

  • Response Time
    Antwortzeit in ms
  • Request Rate
    Anfragen pro Sekunde
  • Error Rate
    Fehlerquote in %
  • Throughput
    Transaktionen/Sekunde
  • Apdex Score
    User Satisfaction (0-1)

Business-Metriken

  • Uptime
    Verfügbarkeit in %
  • MTBF
    Mean Time Between Failures
  • MTTR
    Mean Time to Repair
  • SLA Compliance
    SLA-Einhaltung in %
  • User Sessions
    Aktive Benutzer

Security-Metriken

  • Failed Logins
    Fehlgeschlagene Anmeldungen
  • Firewall Events
    Blockierte Verbindungen
  • Malware Detections
    Erkannte Bedrohungen
  • Vulnerabilities
    Offene Schwachstellen
  • Compliance Score
    Regelkonformität in %

Die 4 Goldenen Signale (Google SRE)

Google empfiehlt, jedes System anhand von 4 Signalen zu überwachen:

  1. Latency: Wie lange dauert eine Anfrage?
  2. Traffic: Wie viele Anfragen pro Sekunde?
  3. Errors: Wie viele Anfragen schlagen fehl?
  4. Saturation: Wie ausgelastet sind die Ressourcen?

4. Monitoring-Tools im Überblick

Die wichtigsten Monitoring-Tools für Enterprise-Umgebungen – von Open Source bis Commercial:

Open Source · Time Series

Prometheus

Cloud-native Monitoring

Das führende Open-Source-Monitoring-System für Cloud-native Umgebungen. Pull-basiert, Time-Series-Datenbank.

  • PromQL (mächtige Abfragesprache)
  • Service Discovery (Kubernetes, AWS)
  • Alertmanager für Alerting
  • CNCF Graduated Project
Preismodell: Kostenlos (Open Source) · Cloud: ~50-200 €/Monat
Open Source · Visualization

Grafana

Dashboards & Visualisierung

Die führende Plattform für Datenvisualisierung. Unterstützt 50+ Datenquellen (Prometheus, InfluxDB, Elasticsearch, SQL).

  • Interaktive Dashboards
  • 50+ Datenquellen
  • Alerting & Annotations
  • Grafana Cloud verfügbar
Preismodell: Kostenlos (OSS) · Cloud: ~0-49 €/Monat
Open Source · Enterprise

Zabbix

Enterprise Monitoring Suite

Umfassende Enterprise-Monitoring-Lösung. Push- und Pull-basiert, ideal für traditionelle IT-Infrastrukturen.

  • Agent-basiert & agentenlos
  • Auto-Discovery
  • Distributed Monitoring
  • Web-Interface & Mobile
Preismodell: Kostenlos (OSS) · Support: ~1.500-5.000 €/Jahr
Commercial · Network

PRTG Network Monitor

All-in-One Monitoring

Deutsche All-in-One-Lösung von Paessler. Einfach zu bedienen, stark in Netzwerk-Monitoring.

  • SNMP, WMI, Packet Sniffing
  • 200+ Sensoren vordefiniert
  • Map-Visualisierung
  • Deutsche Dokumentation
Preismodell: Bis 100 Sensoren gratis · Ab ~1.600 € (500 Sensoren)
Commercial · SaaS

Datadog

Cloud Monitoring Platform

Führende Cloud-Monitoring-Plattform. 500+ Integrationen, APM, Logs, Synthetics, Security in einer Plattform.

  • APM & Distributed Tracing
  • Log Management
  • Synthetics Monitoring
  • AI-basierte Anomalie-Erkennung
Preismodell: Ab ~15 €/Host/Monat · Enterprise: Custom
Open Source · Classic

Nagios

Der Klassiker

Der Urvater des IT-Monitoring. Seit 1999 im Einsatz, riesige Community, tausende Plugins.

  • 5.000+ Plugins
  • Push & Pull Monitoring
  • Nagios XI (Commercial)
  • Große Community
Preismodell: Nagios Core gratis · XI: ~2.000-5.000 €/Jahr
Commercial · SIEM/Logs

Splunk

Machine Data Platform

Führende Plattform für Log-Analyse und SIEM. Mächtige Suchsprache (SPL), Enterprise-Security.

  • SPL (Search Processing Language)
  • SIEM & Security Analytics
  • IT Service Intelligence (ITSI)
  • 1.000+ Apps & Add-ons
Preismodell: Ab ~2.000 €/Monat · Enterprise: Custom
Open Source · Logging

ELK Stack

Elasticsearch + Logstash + Kibana

Der De-facto-Standard für Log-Management. Open Source, mächtige Suchfunktionen, flexible Visualisierung.

  • Full-Text Search
  • Real-time Analytics
  • Machine Learning
  • Elastic Cloud verfügbar
Preismodell: Open Source gratis · Cloud: ~95 €/Monat
Commercial · Enterprise

SolarWinds

IT Management Suite

Umfassende Enterprise-IT-Management-Suite. Network Performance Monitor, Server & Application Monitor.

  • Network Performance Monitor
  • Server & Application Monitor
  • Database Performance Analyzer
  • 200+ Produkte
Preismodell: Ab ~3.000 € · Enterprise: Custom
Tool Typ Open Source Cloud On-Premise Preis
Prometheus Time Series Gratis
Grafana Visualisierung Gratis/Cloud
Zabbix Enterprise Suite Gratis
PRTG Network Monitor Ab 1.600 €
Datadog Cloud Platform Ab 15 €/Host
Nagios Classic Monitor Gratis/Commercial
Splunk SIEM/Logs Ab 2.000 €/Monat
ELK Stack Log Management Gratis/Cloud
SolarWinds IT Management Ab 3.000 €

5. Logging & ELK-Stack

Logs sind das Gedächtnis Ihrer IT-Infrastruktur. Der ELK-Stack ist der De-facto-Standard für Log-Management:

ELK-Stack Architektur

Beats

Datensammler

Logstash

Verarbeitung & Parsing

Elasticsearch

Speicherung & Suche

Kibana

Visualisierung

Beispiel: Prometheus Konfiguration

YAML # prometheus.yml - Prometheus Konfiguration global: scrape_interval: 15s evaluation_interval: 15s alerting: alertmanagers: - static_configs: - targets: - 'alertmanager:9093' scrape_configs: - job_name: 'prometheus' static_configs: - targets: ['localhost:9090'] - job_name: 'node-exporter' static_configs: - targets: ['server1:9100', 'server2:9100'] - job_name: 'kubernetes-pods' kubernetes_sd_configs: - role: pod

Beispiel: Alerting Rules

YAML # alert_rules.yml - Prometheus Alerting Rules groups: - name: 'server-alerts' rules: - alert: HighCPUUsage expr: 100 - (avg by(instance) (rate(node_cpu_seconds_total{mode="idle"}[5m])) * 100) > 80 for: 5m labels: severity: 'warning' annotations: summary: "Hohe CPU-Auslastung auf {{ $labels.instance }}" description: "CPU ist seit 5 Minuten über 80%" - alert: DiskSpaceLow expr: (node_filesystem_avail_bytes / node_filesystem_size_bytes) * 100 < 10 for: 2m labels: severity: 'critical' annotations: summary: "Wenig Speicherplatz auf {{ $labels.instance }}"

Log-Level verstehen

  • DEBUG: Detaillierte Debug-Informationen (nur Entwicklung)
  • INFO: Normale Betriebsinformationen
  • WARN: Potentielle Probleme, aber kein Fehler
  • ERROR: Fehler, die behoben werden müssen
  • FATAL/CRITICAL: Kritische Fehler, System kann nicht weiterlaufen

6. Alerting & Eskalation

Alerting ist das Herzstück proaktiven Monitorings. Richtige Alert-Levels und Eskalationspfade sind entscheidend:

Critical

P1 · Sofort

Systemausfall, Datenverlust, Sicherheitsverletzung. Sofortige Reaktion erforderlich.

Reaktion: On-Call Engineer sofort benachrichtigen (SMS, Anruf). 24/7 Bereitschaft.

High

P2 · 15 Min

Schwere Performance-Probleme, teilweise Ausfälle. Dringende Reaktion nötig.

Reaktion: On-Call Engineer innerhalb 15 Minuten. Eskalation nach 30 Min.

Medium

P3 · 1 Std

Moderate Probleme, degraded performance. Reaktion innerhalb einer Stunde.

Reaktion: Team-Ticket erstellen, während Geschäftszeiten bearbeiten.

Low

P4 · 1 Tag

Informationelle Alerts, keine unmittelbare Auswirkung. Nächster Arbeitstag.

Reaktion: Ticket erstellen, im nächsten Sprint bearbeiten.

Alerting Best Practices

  1. Alert Fatigue vermeiden: Nur actionable Alerts (max. 5-10/Tag pro Engineer)
  2. Runbooks verlinken: Jeder Alert sollte ein Runbook mit Lösungsschritten haben
  3. Multi-Channel Alerting: Email, Slack, SMS, PagerDuty je nach Severity
  4. Escalation Policies: Klare Eskalationspfade definieren
  5. Alert Tuning: Regelmäßig Alerts evaluieren und anpassen
  6. Silencing: Wartungsfenster für geplante Downtimes nutzen

7. SIEM – Security Information & Event Management

SIEM kombiniert Log-Management mit Security-Analytics für Bedrohungserkennung und Incident Response:

Log Aggregation

Zentrale Sammlung aller Security-relevanten Logs aus:

  • Firewalls & IDS/IPS
  • Authentication Systems (AD, LDAP)
  • Endpoint Protection
  • Applications & Databases
  • Cloud Services (AWS CloudTrail, Azure Monitor)
Correlation & Analytics

Intelligente Korrelation von Events zur Erkennung von:

  • Brute-Force-Angriffen
  • Laterale Bewegung im Netzwerk
  • Data Exfiltration
  • Insider Threats
  • Malware-Infektionen
Alerting & Response

Automatisierte Alerts und Response-Aktionen:

  • Echtzeit-Alerts bei Bedrohungen
  • Automatische Blockierung (Firewall Rules)
  • Incident-Ticket-Erstellung
  • SOAR-Integration (Security Orchestration)
  • Forensische Untersuchungen
Compliance & Reporting

Unterstützung für Compliance-Anforderungen:

  • DSGVO (Datenverarbeitung protokollieren)
  • ISO 27001 (Security Monitoring)
  • SOX (Finanz-Transaktionen)
  • HIPAA (Gesundheitsdaten)
  • PCI DSS (Zahlungsverkehr)

Führende SIEM-Lösungen

  • Splunk: Marktführer, mächtige SPL-Suchsprache
  • Microsoft Sentinel: Cloud-native SIEM in Azure
  • IBM QRadar: Enterprise SIEM mit AI
  • Elastic Security: Open Source SIEM (ELK-basiert)
  • Wazuh: Open Source SIEM & XDR
  • ArcSight (Micro Focus): Klassisches Enterprise SIEM

8. Best Practices für Monitoring

Die wichtigsten Empfehlungen für erfolgreiches Monitoring & Logging:

Metriken-Strategie

  • USE-Methode (Utilization, Saturation, Errors)
  • RED-Methode (Rate, Errors, Duration)
  • 4 Golden Signals (Google SRE)
  • Business-Metriken definieren
  • Baseline erstellen (Normalzustand)

Alerting-Strategie

  • Alert Fatigue vermeiden
  • Severity-Levels definieren
  • Runbooks für jeden Alert
  • Multi-Channel Notification
  • Regelmäßiges Alert-Tuning

Logging-Strategie

  • Strukturierte Logs (JSON)
  • Zentrale Log-Aggregation
  • Log-Retention definieren
  • Sensible Daten maskieren
  • Log-Level konsistent nutzen

Dashboard-Design

  • Role-based Dashboards
  • Golden Signals prominent
  • Drill-down ermöglichen
  • Mobile-friendly gestalten
  • TV-Displays im NOC

Automatisierung

  • Infrastructure as Code (IaC)
  • Auto-Scaling basierend auf Metriken
  • Self-healing Systems
  • Automated Remediation
  • CI/CD für Monitoring-Configs

Security Monitoring

  • SIEM implementieren
  • Threat Intelligence integrieren
  • Anomaly Detection (ML)
  • Incident Response Plan
  • Regelmäßige Security Audits

Goldene Regeln für Monitoring

  1. Monitor what matters: Nicht alles überwachen, nur Business-kritische Metriken
  2. Start simple: Mit Basis-Monitoring beginnen, dann erweitern
  3. Automate everything: Monitoring-Config als Code versionieren
  4. Test your alerts: Regelmäßig Alert-Wege testen (Chaos Engineering)
  5. Document runbooks: Für jeden kritischen Alert ein Runbook
  6. Review & iterate: Monitoring ist nie "fertig" – kontinuierlich verbessern

9. FAQ – Häufige Fragen

Häufige Fragen zu Monitoring & Logging

Was ist der Unterschied zwischen Monitoring und Observability?

Monitoring zeigt dir, ob etwas kaputt ist (bekannte Probleme). Observability hilft dir zu verstehen, warum etwas kaputt ist (unbekannte Probleme).

Observability basiert auf 3 Säulen: Metrics, Logs und Traces. Sie ermöglicht es, durch komplexe Systeme zu "sehen" und Root Causes zu finden, ohne vorher bekannte Fragen stellen zu müssen.

Wie viele Daten sollte ich loggen?

So viel wie nötig, so wenig wie möglich. Richtwerte:

  • Produktion: INFO und höher (WARN, ERROR, FATAL)
  • Staging: DEBUG und höher
  • Entwicklung: Alle Log-Levels

Wichtig: Log-Retention definieren (z.B. 30 Tage hot, 1 Jahr cold, 7 Jahre Compliance).

Was kostet professionelles Monitoring?

Die Kosten variieren stark je nach Größe und Anforderungen:

  • Small Business (10-50 Server): 200-1.000 €/Monat
  • Mid-Market (50-500 Server): 1.000-10.000 €/Monat
  • Enterprise (500+ Server): 10.000-100.000+ €/Monat

Open-Source-Lösungen (Prometheus, Grafana, ELK) sind kostenlos, aber erfordern Betriebsaufwand.

Wie vermeide ich Alert Fatigue?

Alert Fatigue ist eines der größten Probleme im Monitoring. Strategien dagegen:

  • Alert nur bei actionable Problemen: Wenn kein Engineer etwas tun kann, kein Alert
  • Thresholds richtig setzen: Nicht zu sensibel
  • Alert grouping: Zusammenhängende Alerts gruppieren
  • Regelmäßiges Tuning: Alerts quarterly evaluieren
  • Max. 5-10 Alerts/Tag pro Engineer: Als Richtwert
Was ist Distributed Tracing?

Distributed Tracing verfolgt Anfragen durch verteilte Systeme (Microservices). Es zeigt:

  • Welche Services eine Anfrage durchläuft
  • Wie lange jeder Schritt dauert
  • Wo Engpässe oder Fehler auftreten

Tools: Jaeger, Zipkin, AWS X-Ray, Datadog APM. Wichtig für Microservice-Architekturen.

Wie lange sollte ich Logs aufbewahren?

Log-Retention hängt von Anforderungen ab:

  • Hot Storage (schnelle Suche): 7-30 Tage
  • Warm Storage (gelegentliche Suche): 30-90 Tage
  • Cold Storage (Archiv): 1-7 Jahre
  • Compliance (DSGVO, SOX): Bis 10 Jahre

Tipp: Tiered Storage nutzen – alte Logs automatisch archivieren.

Was ist APM (Application Performance Monitoring)?

APM überwacht die Performance von Anwendungen aus Benutzersicht:

  • Response Times
  • Error Rates
  • Throughput
  • Database Queries
  • External API Calls

Tools: Dynatrace, New Relic, AppDynamics, Datadog APM, Elastic APM.

Wie starte ich mit Monitoring in einem kleinen Unternehmen?

Empfohlener Start für kleine Unternehmen:

  1. Phase 1 (Woche 1-2): Basis-Monitoring mit PRTG (gratis bis 100 Sensoren) oder Uptime Kuma
  2. Phase 2 (Monat 1-2): Prometheus + Grafana für Server-Metriken
  3. Phase 3 (Monat 3-6): ELK Stack für Log-Management
  4. Phase 4 (Monat 6+): Alerting, Dashboards, Runbooks

Wichtig: Nicht alles auf einmal – inkrementell aufbauen.

Zusammenfassung

Die wichtigsten Punkte

  • Monitoring: Kontinuierliche Überwachung von IT-Systemen und Anwendungen
  • Logging: Aufzeichnung von Events für Troubleshooting und Compliance
  • Metriken: Infrastruktur (CPU, RAM), Application (Response Time, Error Rate), Business (Uptime, MTTR)
  • Tools: Prometheus, Grafana, Zabbix, PRTG, Datadog, Nagios, Splunk, ELK
  • ELK-Stack: Elasticsearch + Logstash + Kibana (+ Beats) für Log-Management
  • Alerting: 4 Levels (Critical, High, Medium, Low) mit Eskalationspfaden
  • SIEM: Security Information & Event Management für Bedrohungserkennung
  • Best Practices: USE/RED-Methoden, 4 Golden Signals, Alert Fatigue vermeiden
  • ROI: 10-40× durch vermiedene Ausfälle und schnellere Lösung
  • Trend: Observability (Metrics + Logs + Traces), AI-basierte Anomalie-Erkennung

Nächste Schritte

Bereit, Monitoring in Ihrer Organisation aufzubauen? Hier ein empfohlener Weg:

  1. Assessment: Aktuelle Infrastruktur analysieren (Server, Anwendungen, Netzwerke)
  2. Use Cases definieren: Was soll überwacht werden? (Verfügbarkeit, Performance, Security)
  3. Tool-Auswahl: Open Source (Prometheus/Grafana) oder Commercial (Datadog/PRTG)?
  4. PoC durchführen: 2-4 Wochen Test mit 5-10 Servern
  5. Phasenweiser Rollout: Basis → Erweitert → Advanced → SIEM
  6. Continuous Improvement: Monitoring ist nie "fertig" – kontinuierlich verbessern

Weiterführende Themen

Server & Clients

Server-Architekturen, Virtualisierung und Client-Management im Detail.

Zu Server & Clients
IT-Sicherheit

Security-Grundlagen, Kryptographie, Netzwerksicherheit und Compliance.

Zur IT-Sicherheit
Cloud Computing

IaaS, PaaS, SaaS, Azure, AWS – Cloud-Infrastruktur verstehen.

Zu Cloud Computing
Netzwerk-Grundlagen

TCP/IP, Subnetting, Routing – Netzwerke für Monitoring verstehen.

Zu Netzwerk-Grundlagen