LeitfädenPlaybook

Datenbereinigungs-Pipeline

Eine dokumentierte, reproduzierbare Datenbereinigungspipeline von Roh zu analysereif.

Fortgeschritten
Playbook

Datenbereinigungs-Pipeline

Eine dokumentierte, reproduzierbare Datenbereinigungspipeline von Roh zu analysereif.

Schritte5Zeit~65 Min.ArtefaktBereinigungs-NotebookLevelintermediate
Bevor du startest
  • Ein zu bereinigender unordentlicher Datensatz
  • Grundkenntnisse in Python oder R
Tools in this guide
0%0/5 Schritte

Datenforscher · 60–90 Minuten

Die meiste Datenanalysezeit ist Bereinigung — aber niemand dokumentiert es.

Dieses Runbook macht jeden Bereinigungsschritt explizit, dokumentiert und umkehrbar.

Bereinigungs-Notebook

Bereinigungs-Notebook

Ein Jupyter-Notebook mit profilierten Daten, dokumentierten Transformationen und einem Vorher/Nachher-Vergleich.

Rohdaten profilieren

10 Min.

Analysiere Shape, dtypes, fehlende-Werte-Zahlen und grundlegende Statistiken. Dokumentiere alles, bevor du die Daten berührst.

Datenprofil-Zusammenfassung mit Spaltentypen und fehlenden Zahlen.
Fallstrick
Profil überspringen — stille Typfehler und Kodierungsprobleme werden übersehen.
Verifikation
Das Profil zeigt jeden Spaltentyp, Non-Null-Anzahl und Beispielwerte.

Fehlende Werte behandeln

20 Min.Claude

Für jede Spalte mit fehlenden Werten: Muster dokumentieren, Strategie wählen (löschen, interpolieren, markieren) und Begründung schreiben.

Fehlende-Werte-Strategietabelle pro Spalte.
Fallstrick
Alle Zeilen mit fehlenden Werten löschen — du verlierst möglicherweise 50% der Daten lautlos.
Verifikation
Jede Imputationswahl hat eine Begründung, die am fehlenden Mechanismus hängt (MCAR, MAR, MNAR).

Formate standardisieren

15 Min.

Normalisiere Datumsformate, Groß-/Kleinschreibung, numerische Einheiten und kategorische Labels in allen Spalten.

Konsistente Format-Dokumentation.
Fallstrick
Annehmen, Datumsformate seien in allen Spalten gleich — sind sie nie.
Verifikation
Alle Datumsspalten parsen in dasselbe Datumsformat. Alle Strings sind gleichmäßig formatiert.

Bereinigte Daten validieren

10 Min.Claude

Profil erneut auf bereinigte Daten anwenden und mit Original vergleichen. Prüfen, dass keine unerwarteten Zeilen verloren gingen.

Vorher/Nachher-Vergleich mit Zeilenzahlen und Wertverteilungen.
Fallstrick
Vergleich Vorher/Nachher vergessen — Bereinigungsfehler löschen oft lautlos gültige Zeilen.
Verifikation
Zeilenzahlen-Änderung ist dokumentiert und begründet. Wertverteilungen sind plausibel.

Pipeline dokumentieren

10 Min.

Schreibe eine Zusammenfassungszelle mit allen angewandten Transformationen in Reihenfolge und Begründung.

Bereinigungs-Pipeline-Dokumentation.
Fallstrick
Notebook undokumentiert lassen — in sechs Monaten erinnerst du dich nicht an die Reihenfolge.
Verifikation
Ein Kollege könnte das Notebook von oben nach unten ausführen und den bereinigten Datensatz reproduzieren.
Zielgerade

Du solltest jetzt haben: Bereinigungs-Notebook.

  • Das Datenprofil ist vor und nach der Bereinigung dokumentiert.
  • Jeder fehlende Wert hat eine dokumentierte Strategie und Begründung.
  • Die bereinigten Daten validieren gegen das erwartete Schema.

DatenschutzLade keine Rohdatensätze mit PII in Cloud-Tools. Anonymisiere oder sample vor der Nutzung von KI-Assistenten für Bereinigungscode-Review.