Einleitung

Entscheidungsbaumalgorithmen bleiben ein Eckpfeiler des maschinellen Lernens für Klassifizierungs- und Regressionsaufgaben aufgrund ihrer intuitiven Struktur, Interpretierbarkeit und Fähigkeit, nichtlineare Beziehungen zu modellieren. Reale Datensätze sind jedoch selten unberührt; sie enthalten häufig fehlende Werte, die durch Sensorfehler, menschliches Versagen, Datenintegrationsprobleme oder datenschutzmotivierte Redaktionen verursacht werden. Das Ignorieren dieser Lücken kann die Modellleistung beeinträchtigen, Verzerrungen einführen und zu unzuverlässigen Vorhersagen führen. Der richtige Umgang mit fehlenden Daten ist daher unerlässlich, um robuste Entscheidungsbaummodelle zu erstellen, die gut verallgemeinern. Dieser Artikel bietet eine tiefgründige, praktische Erkundung fehlender Datenmechanismen, traditionelle und moderne Handhabungstechniken und umsetzbare Anleitungen für Praktiker, die Entscheidungsbäume auf unvollständigen Datensätzen einsetzen müssen.

Fehlende Daten verstehen

Fehlende Daten sind kein einheitliches Problem. Die geeignete Handhabungsstrategie hängt vom Mechanismus ab, der die fehlenden Daten erzeugt hat. Die Statistiker haben fehlende Daten in drei verschiedene Typen eingeteilt, von denen jeder unterschiedliche Auswirkungen auf die Analyse hat.

Komplett vermisst bei Random (MCAR)

Bei MCAR ist die Wahrscheinlichkeit, dass ein Wert fehlt, völlig unabhängig von beobachteten und nicht beobachteten Daten. Beispielsweise versagt ein Laborgerät gelegentlich in zufälligen Abständen, die nicht mit der zu untersuchenden Probe zusammenhängen, oder ein Umfrageteilnehmer überspringt versehentlich eine Frage. MCAR ist der am einfachsten analytisch zu handhabende Typ, da die beobachteten Daten eine repräsentative Zufallsstichprobe des vollständigen Datensatzes bleiben.

Vermisst bei Random (MAR)

MAR tritt auf, wenn die fehlenden Werte nur von den beobachteten Variablen abhängen und nicht von den fehlenden Werten selbst. So könnte beispielsweise in einem Kreditrisikodatensatz das Einkommen für jüngere Antragsteller wahrscheinlicher fehlen (beobachtetes Alter), aber das fehlende Einkommen hängt bei gegebenem Alter nicht vom tatsächlichen Einkommensniveau ab. Viele Standard-Imputationsmethoden gehen von MAR aus, und Techniken wie Mehrfachimputation oder Maximalwahrscheinlichkeitsschätzung bleiben unter dieser Annahme gültig. MAR ist in vielen geschäftlichen und wissenschaftlichen Kontexten ein plausibler Mechanismus.

Nicht bei Zufall fehlen (MNAR)

In MNAR hängt die Wahrscheinlichkeit des Fehlens mit dem unbeobachteten Wert selbst zusammen. Ein klassisches Beispiel sind Lohnerhebungen: Personen mit hohem Einkommen können sich weigern, ihre Einkünfte offenzulegen, was bedeutet, dass die fehlende Einkünfte direkt mit dem fehlenden Wert (Einkommen) korreliert. MNAR ist das schwierigste Szenario, da die fehlenden Werte ohne externe Informationen oder spezielle Modellierungstechniken (z. B. Auswahlmodelle oder Mustermischungsmodelle) nicht zuverlässig geschätzt werden können.

Identifizierung fehlender Datenmuster

Bevor sie eine Handhabungsmethode wählen, sollten die Praktiker das Fehlen von Daten in ihrem Datensatz untersuchen.

  • Missingness heatmaps – visualisieren Sie den Anteil der fehlenden Werte pro Merkmal und pro Probe.
  • Littles MCAR-Test – ein formaler statistischer Test, der anzeigt, ob MCAR plausibel ist.
  • Groupwise missingness statistics – berechnen Sie den Mittelwert der beobachteten Merkmale abhängig davon, ob ein anderes Merkmal fehlt; große Unterschiede deuten auf MAR oder MNAR hin.

Das Verständnis des Mechanismus bildet die Grundlage für die Auswahl einer geeigneten Imputations- oder Modellierungsstrategie.

Folgen des Ignorierens fehlender Daten

Viele naive Ansätze – wie z.B. listweises Löschen (einfach Zeilen mit fehlendem Wert entfernen) oder paarweises Löschen – werden in der Praxis immer noch verwendet, sind aber mit erheblichen Kosten verbunden:

  • Reduzierte Stichprobengröße – eine listweise Löschung kann einen großen Teil der Daten verwerfen, insbesondere bei vielen Funktionen, was zu einer hohen Varianz und einer niedrigen statistischen Leistungsfähigkeit führt.
  • Biased parameter estimates – falls die fehlende Zahl nicht MCAR ist, ist die zurückgehaltene Stichprobe nicht mehr repräsentativ. Diese Verzerrung breitet sich direkt in Entscheidungsbaumsplits aus, was zu falschen Schwellenwerten und suboptimaler Knotenreinheit führt.
  • Verlust von Informationen – Merkmale mit fehlenden Werten können von der Aufteilungslogik ausgeschlossen werden, was ein prädiktives Signal verschwendet, das über Ersatzsplits oder Imputation verwendet werden könnte.
  • Inkonsistente Handhabung über Bäume hinweg – Ensemble-Methoden wie zufällige Wälder können fehlende Werte in jedem Basisbaum unterschiedlich behandeln, was zu instabilen Vorhersagen führt.

Eine gut durchdachte Behandlung fehlender Daten verbessert sowohl die Genauigkeit als auch die Zuverlässigkeit, insbesondere bei Anwendungen mit hohem Einsatz wie medizinische Diagnose, finanzielle Risikobewertung und vorausschauende Wartung.

Traditionelle Imputationsmethoden

Die Imputation – das Ausfüllen von fehlenden Werten mit geschätzten Werten – ist der am weitesten verbreitete Ansatz, wobei die Wahl der Imputationsverfahren vom Datentyp, dem Fehlensmechanismus und dem Berechnungsbudget abhängt.

Einfache unvariate Imputation

Die einfachsten Techniken ersetzen einen fehlenden Wert durch den Mittelwert, Median oder Modus der beobachteten Werte für dieses Merkmal. Obwohl diese Methoden schnell sind, ignorieren sie Korrelationen zwischen Merkmalen und neigen dazu, die Varianz zu verringern, was das Modellvertrauen künstlich aufbläht. Die mittlere Imputation ist nur unter MCAR und für Merkmale mit ungefähr symmetrischen Verteilungen angemessen. Die mittlere Imputation ist robuster für Ausreißer. Die Modenimputation wird für kategorische Merkmale verwendet, kann jedoch Verzerrungen hervorrufen, wenn die dominante Kategorie nicht repräsentativ ist.

Regressionsimputation

Regressionsimputation modelliert das Merkmal mit fehlenden Werten als Funktion anderer vollständiger Merkmale. Eine lineare Regression wird auf die beobachteten Einträge angepasst und dann zur Vorhersage der fehlenden verwendet. Dies bewahrt die Beziehungen zwischen Variablen, setzt jedoch Linearität voraus und kann zu Überanpassungen führen, wenn die gleichen Daten sowohl für die Imputation als auch für das Modelltraining verwendet werden. Fortgeschrittene Versionen verwenden iterative Methoden wie Kettengleichungen (MICE), die Merkmale bis zur Konvergenz durchlaufen.

k‐Nächste Nachbarn (KNN)

Die KNN-Imputation findet die k ähnlichsten vollständigen Samples (nach Entfernung bei beobachteten Merkmalen) und Mittelwerte (oder nimmt eine Mehrheit für diese an). Sie erfasst natürlich nichtlineare Abhängigkeiten und funktioniert gut mit gemischten Datentypen. Die Hauptnachteile sind die Rechenkosten für große Datensätze und die Empfindlichkeit gegenüber der Wahl der k- und Entfernungsmetrik. KNN geht davon aus, dass der Abwesenheitsmechanismus MCAR oder MAR ist und dass die Entfernungsmetrik für den Merkmalsraum aussagekräftig ist.

Mehrfachimputation

Mehrfache Imputation (z. B. mit dem MCMC oder MICE-Algorithmus) erzeugt mehrere vollständige Datensätze durch Imputation von Werten aus einem statistischen Modell, das Unsicherheit enthält. Der Analyst passt dann einen Entscheidungsbaum an jeden imputierten Datensatz an und bündelt die Ergebnisse (z. B. durch Mittelung vorhergesagter Wahrscheinlichkeiten oder durch Rubin-Regeln). Dieser Ansatz spiegelt die Imputationsunsicherheit richtig wider und ist unter MAR robust. Obwohl er rechentechnisch schwerer ist, ist er der Goldstandard für viele statistische Anwendungen und wird in Python über Bibliotheken wie oder in scikit‐learn unterstützt.

Grenzen der einfachen Imputation

Keine Imputation ist ein Allheilmittel. Einfache Imputation kann die gemeinsame Verteilung von Merkmalen verzerren, was es Entscheidungsbäumen erschwert, saubere Splits zu finden. Darüber hinaus ist Imputation ein von der Bauminduktion getrennter Vorverarbeitungsschritt; der Baumalgorithmus „weiß nicht, dass ein Wert imputiert wurde. Dies kann zu zu optimistischen Leistungsschätzungen führen, wenn die Imputation nicht in einer Kreuzvalidierungsschleife entsprechend validiert wird. Schließlich geht die Imputation davon aus, dass der Fehlensmechanismus nicht erkennbar ist – er ist ohne zusätzliche Modellierung nicht für MNAR geeignet.

Surrogat Splits in Entscheidungsbäume

Anstatt die Daten vorzuverarbeiten, behandeln einige Entscheidungsbaumalgorithmen - vor allem die ursprünglichen CART (Classification and Regression Trees) - fehlende Werte nativ mit Surrogatsplits Diese Technik ist elegant, weil sie die Baumstruktur selbst nutzt, um Lücken zu bewältigen, ohne die Rohdaten zu verändern.

Wie Surrogate Splits funktionieren

Beim Erstellen eines Baums wählt der Algorithmus die beste Aufteilung an einem Knoten aus, basierend auf allen nicht fehlenden Werten des primären Merkmals (z. B. "Einkommen > 50.000 $"). Anschließend sucht er nach einem oder mehreren Ersatzmerkmalen, die diese Aufteilung am besten nachahmen. Ein Ersatzmerkmale wird durch ein anderes Merkmal definiert (z. B. "Bildungsniveau = Hochschulabsolvent"), das bei Verwendung auf der Datenuntermenge, in der das Einkommen beobachtet wird, eine Partition erzeugt, die der primären Aufteilung so ähnlich wie möglich ist. Bei der Vorhersage fällt der Algorithmus zurück, wenn das primäre Merkmal für eine Stichprobe fehlt, wenn dieser ebenfalls fehlt, verwendet er das nächste Ersatzsmerkmal und so weiter. Wenn kein Ersatz verfügbar ist, wird die Stichprobe über den Mehrheitszweig oder einen vordefinierten Pfad gesendet.

Vorteile und Nachteile

Surrogat-Splits haben den großen Vorteil, dass sie keine Imputation erfordern – der Baum lernt aus allen verfügbaren Daten, ohne Werte zu fabrizieren. Sie bewahren auch die bedingte Beziehung, die während des Baumaufbaus gelernt wird. Die Technik erfordert jedoch, dass einige korrelierte Merkmale existieren, um als Surrogate zu dienen; wenn das fehlende Merkmal keine starken Korrelate aufweist, werden die Surrogat-Splits schwach und der Baum kann immer noch an Genauigkeit für fehlende Einträge verlieren. Darüber hinaus unterstützen viele moderne Implementierungen (z. B. scikit‐learn ) Surrogat-Splits aus der Box nicht - sie sind in erster Linie in R Paket und in einigen kommerziellen Software vorhanden. Für Python-Benutzer, die Surrogat-Splits benötigen, kann das R-Paket oder die Bibliothek eine Option sein, die jedoch Komplexität hinzufügt. Häufiger wenden sich Praktiker an gradientenverstärkte Baumbibliotheken, die erweitertes Missing‐Value-Handling beinhalten.

Modellbasierte Ansätze und moderne Algorithmen

In den letzten Jahren sind gradientensteigernde Frameworks gestiegen, die die Behandlung von Fehlwerten direkt in den Lernalgorithmus integrieren und oft sowohl Imputation als auch Surrogat-Splits in der prädiktiven Leistung übertreffen.

XGBoost

XGBoost (Extreme Gradient Boosting) lernt, wie man mit fehlenden Werten während des Trainings umgeht, indem man die fehlenden Werte als spärliches Signal behandelt. Bei jedem Split wertet der Algorithmus sowohl eine Standardrichtung für fehlende Daten (links oder rechts Kind) als auch den optimalen Splitwert für die beobachteten Einträge aus. Die Standardrichtung wird so gewählt, dass die Verlustfunktion minimiert wird, wodurch effektiv gelernt wird, ob fehlende Samples nach links oder rechts gehen. Dieser Ansatz erfordert keine Imputation und ist hoch effizient, da fehlende Werte als spärliche Matrizen dargestellt werden, die Speicher speichern. XGBoosts Handhabung funktioniert gut unter MAR und sogar einigen MNAR-Szenarien, da sich das Modell auf der Grundlage der Korrelation zwischen fehlendem und dem Ziel anpasst.

LightGBM

LightGBM geht einen anderen Weg: Es behandelt Null- und fehlende Werte als eine einzige Gruppe (standardmäßig) und optimiert die Split-Richtung für diese Gruppe. Während des Trainings lernt es, ob fehlende Proben zum linken oder rechten Kind einer Split gehören. Wie XGBoost erfordert es keine Imputation und verarbeitet spärliche Daten effizient. Das blattweise Wachstum des LightGBM-Baums führt oft auch zu schnellerem Training und besserer Genauigkeit, obwohl Vorsicht geboten ist, um Überanpassungen zu vermeiden.

CatBoost

CatBoost (Categorical Boosting) verwendet einen etwas anderen Mechanismus: Er behandelt fehlende Werte als separate Kategorie und lässt den Baum entscheiden, wann er sich auf diese Kategorie aufteilen soll. Für numerische Merkmale werden fehlende Werte zunächst einem Platzhalter zugewiesen (z. B. -1) und der Baum findet eine optimale Aufteilung auf der Grundlage dieser Behandlung. CatBoost ist besonders stark für Datensätze mit kategorischen Merkmalen und kann MNAR-ähnliche Muster verarbeiten, indem er separate Blattpfadlogik für fehlende Werte erstellt. Alle drei Bibliotheken sind produktionsbereit, unterstützen Python / R / CLI-Schnittstellen und bieten eingebaute Kreuzvalidierung.

Fehlender Daten-Handling in der Praxis umsetzen

Die Wahl einer Strategie hängt von den Werkzeugen, der Datengröße und dem Fehlenmuster ab.

  1. Beurteilen Sie die Fehlwerte – berechnen Sie den Prozentsatz der fehlenden Werte pro Feature und pro Sample. Wenn ein Feature >90% fehlt, sollten Sie es fallen lassen, es sei denn, das Domänenwissen ist stark. Visualisieren Sie Korrelationen zwischen Fehlindikatoren und beobachteten Features mit einer Heatmap oder einem χ2-Test.
  2. Identifizieren Sie den Mechanismus – wenden Sie den MCAR-Test von Little an, wenn die Stichprobe groß genug ist. Wenn MCAR plausibel ist, kann eine listenweise Löschung für kleine Fehlstellen (<5%) akzeptabel sein. Für MAR oder MCAR mit mäßiger Fehlstellenzahl ist die imputation oder modellbasierte Handhabung sicherer. Für MNAR sollten Sie zusätzliche Daten sammeln oder Mustermischungsmodelle verwenden.
  3. Wähle eine Methode basierend auf deinem Framework:
    • Wenn du sklearn decision trees (keine eingebaute fehlende Unterstützung) verwendest, verwende einen Imputer (z.B. oder ) innerhalb eines und wähle die Imputationsstrategie über Cross-Validation.
    • Wenn XGBoost/LightGBM/CatBoost verwendet wird, ist keine Imputation erforderlich – geben Sie die Daten einfach mit -Werten weiter; die Frameworks werden sie behandeln.
    • Wenn Sie Rs verwenden, aktivieren Sie den -Parameter, um Ersatzsplits zu aktivieren.
  4. Tune Hyperparameter, die die fehlende Handhabung beeinflussen – für XGBoost können die und die Optionen für den Zweig fehlender Werte beeinflussen. Für CatBoost steuert , wie fehlende numerische Werte behandelt werden (als Klasse oder unterstellt). Testen Sie verschiedene Konfigurationen.
  5. Richtig validieren – immer fehlende Datenverarbeitung innerhalb einer Kreuzvalidierungsschleife (z. B. Imputation vor Zug-/Testteilung, um Datenlecks zu vermeiden) einschließen.

Best Practices und häufige Fallstricke

  • Imputieren Sie die Zielvariable nicht – die Unterwerfung des Ziels in einem überwachten Kontext verzerrt das Lernsignal.
  • Verwenden Sie Domänenwissen – in vielen Bereichen hat das Fehlen selbst eine Bedeutung. Zum Beispiel könnte ein fehlender Labortest darauf hindeuten, dass der Arzt keinen Verdacht auf eine Erkrankung hat, was nützliche Informationen liefert. Einige Baumimplementierungen ermöglichen es Ihnen, ein fehlendes Indikatormerkmal explizit zu erstellen, um den Baum auf das Fehlen als binäre Variable aufteilen zu lassen.
  • Vor hochdimensionalen spärlichen Daten hüten – wenn die meisten Merkmale häufig fehlende Einträge aufweisen, kann die Imputation sehr unsicher werden.
  • Ensemble of Imputation models – for critical applications, consider using multiple imputation and averaging decision trees across imputed datasets (d.h. multiple imputation + ensemble). This is computationally heavy but can improve robustness under MAR.
  • Die Bereitstellungsleistung überwachen – das Fehlenmuster kann sich im Laufe der Zeit verschieben (Konzeptdrift).

Schlussfolgerung

Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainModerne Gradientenverstärkungs-Frameworks – XGBoost, LightGBM und CatBoost – haben einen neuen Standard gesetzt, indem sie optimale Fehlwertrichtungen Ende-zu-Ende gelernt haben, was oft eine überlegene prädiktive Genauigkeit ohne Vorverarbeitung ergibt. Letztendlich besteht die beste Praxis darin, mehrere Methoden systematisch auf einem Validierungssatz zu bewerten, wobei Domänenwissen zur Verfeinerung der Auswahl verwendet wird. Durch die Behandlung fehlender Daten als Quelle wertvoller Informationen und nicht als Ärgernis können Praktiker Entscheidungsbaummodelle erstellen, die sowohl genau als auch zuverlässig sind.

Weiterlesen: Missing Data – Wikipedia deckt die statistische Theorie ab; scikit‐learn Imputation Documentation liefert Implementierungsdetails; und das XGBoost missing value tutorial bietet ein Codebeispiel für native Handhabung.