robotics-and-intelligent-systems
Manejo de datos perdidos en los algoritmos de árbol de decisión
Table of Contents
Introducción
Los algoritmos de los árboles de decisión siguen siendo una piedra angular del aprendizaje automático para tareas de clasificación y regresión debido a su estructura intuitiva, interpretación y capacidad para modelar relaciones no lineales. Sin embargo, los conjuntos de datos del mundo real raramente son prístinos; con frecuencia contienen valores perdidos causados por fallos de sensores, errores humanos, problemas de integración de datos o manipulación de la privacidad.
Comprender datos perdidos
Los datos perdidos no son un problema uniforme. La estrategia de manejo adecuada depende del mecanismo que generó la falta. Los estadísticos han clasificado los datos perdidos en tres tipos distintos, cada uno con diferentes implicaciones para el análisis.
Desaparecido completamente en Random (MCAR)
Bajo MCAR, la probabilidad de que un valor se pierda es totalmente independiente de los datos observados y no guardados. Por ejemplo, un instrumento de laboratorio ocasionalmente falla a intervalos aleatorios no relacionados con la muestra bajo prueba, o una encuesta encuesta encuesta encuestada salta accidentalmente una pregunta. MCAR es el tipo más fácil de manejar analíticamente porque los datos observados siguen siendo una muestra representativa al azar del conjunto de datos completo.
Desaparecido en el azar (MAR)
MAR ocurre cuando la falta depende solamente de las variables observadas y no de los valores propios desaparecidos. Por ejemplo, en un conjunto de datos de riesgo crediticio, los ingresos podrían ser más probables desaparecidos para los solicitantes más jóvenes (edad observada) pero, dada la edad, los ingresos faltantes no dependen del nivel de ingresos real. Muchos métodos de imputación estándar suponen MAR, y técnicas como la imputación múltiple o la estimación de probabilidad máxima siguen siendo válidas bajo esta hipótesis.
No falta en el azar (MNAR)
En MNAR, la probabilidad de falta de personal se relaciona con el valor no observado en sí mismo. Un ejemplo clásico está en encuestas salariales: los individuos de ingresos altos pueden negarse a revelar sus ingresos, lo que significa que la falta correlaciona directamente con el valor perdido (ingresos). MNAR es el escenario más difícil porque los valores perdidos no pueden ser estimados fiablemente sin información externa o técnicas especiales de imputación de modelos (por ejemplo, modelos de selección o modelos de Ignos).
Identificar los patrones de datos perdidos
Antes de elegir un método de manejo, los practicantes deben explorar el patrón de falta en su conjunto de datos.
- Missingness heatmaps – visualiza la proporción de valores perdidos por característica y por muestra.
- La prueba MCAR de la pequeña – una prueba estadística formal que indica si el MCAR es plausible.
- Estadísticas de la pérdida de fondos] – computar la media de las características observadas condicionadas a si se pierde otra característica; grandes diferencias sugieren MAR o MNAR.
Entender el mecanismo establece la base para seleccionar una estrategia apropiada de imputación o modelado.
Consecuencias de Ignorar Datos Desaparecidos
Muchos enfoques ingenuos, como la eliminación de listones (simly la eliminación de filas con cualquier valor perdido) o la eliminación de pares, todavía se utilizan en la práctica, pero vienen con costos sustanciales:
- Tamaño de muestra reducido – eliminación de la lista puede descartar una gran fracción de los datos, especialmente con muchas características, lo que conduce a una alta variabilidad y una baja potencia estadística.
- Estimaciones del parámetro hermético – si la falta no es MCAR, la muestra retenida ya no es representativa. Este sesgo se propaga directamente en las divisiones de los árboles de decisión, causando umbrales incorrectos y pureza sub-optimal del nodo.
- La pérdida de información – características con valores perdidos pueden ser excluidos de la lógica de división en conjunto, desperdiciando señal predictiva que podría haber sido utilizada a través de divisiones o imputaciones surrogadas.
- Manejo inconsistente a través de los árboles] – métodos conjuntos como los bosques aleatorios pueden tratar los valores perdidos de forma diferente en cada árbol base, dando predicciones inestables.
Un tratamiento de datos perdidos bien diseñado mejora tanto la precisión como la fiabilidad, especialmente en aplicaciones de alto rendimiento como diagnóstico médico, evaluación de riesgos financieros y mantenimiento predictivo.
Métodos de imputación tradicionales
La imputación – llenando valores perdidos con valores estimados – es el enfoque más utilizado. La elección del método de imputación depende del tipo de datos, mecanismo de falta y presupuesto computacional.
Imputación simple Univariada
Las técnicas más simples reemplazan un valor perdido con el medio, mediana o modo de los valores observados para esa característica. Mientras que rápido, estos métodos ignoran las correlaciones entre características y tienden a reducir la variabilidad, inflar artificialmente la confianza del modelo. La imputación media es apropiada sólo bajo MCAR y para características con distribuciones aproximadamente simétricas; la imputación mediana es más robusta para los outliers.
Impulsión de regresión
La imputación de regresión modela la función con valores perdidos como función de otras características completas. Una regresión lineal se ajusta a las entradas observadas y luego se utiliza para predecir las faltas. Esto preserva las relaciones entre variables pero asume la linealidad y puede conducir a sobre-ajustar si los mismos datos se utilizan tanto para la imputación como para el entrenamiento de modelos.
k‐Nearest Neighbors (KNN) Imputation
La imputación de KNN encuentra las muestras completas más similares (por distancia de las características observadas) y promedios (o toma una mayoría de votos por) sus valores. Naturalmente captura dependencias no lineales y funciona bien con tipos de datos mixtos. Los principales inconvenientes son costos computacionales para conjuntos de datos grandes y sensibilidad a la elección de k y distancia métrica. KNN asume el mecanismo de falta es MCAR o MAR y que la característica de distancia es el espacio significativo.
Múltiples imputaciones
La imputación múltiple (por ejemplo, utilizando el algoritmo MCMC o MICE) genera varios conjuntos de datos completos imputing values from a statistical model that incorporates uncertainty. The analist then fits a decision tree to each imputed dataset and pools the results (e.g., by averaging predicted probabilities or using Rubin’s rules).Este enfoque refleja adecuadamente la incertidumbre de imputación y es robusto bajo las bibliotecas computas
Limitaciones de la imputación simple
No método de imputación es una panacea. La imputación simple puede distorsionar la distribución conjunta de características, lo que hace más difícil que los árboles de decisión encuentren divisiones limpias. Además, la imputación es un paso preprocesador separado de la inducción del árbol; el algoritmo del árbol no “conoce” que un valor fue imputado. Esto puede conducir a estimaciones de rendimiento excesivamente optimista si la imputación no es validada apropiadamente dentro de un modelo de la imputación cruzada.
Separaciones de la órbita en los árboles de decisión
En lugar de preprocesar los datos, algunos algoritmos de árboles de decisión – sobre todo el CART original (Clasificación y Árboles de Regreso) – manejan valores perdidos nativamente utilizando divisiones de la superficie. Esta técnica es elegante porque aprovecha la estructura de los árboles para tratar con vacíos sin modificar los datos brutos.
Cómo funciona Surrogate Splits
Cuando se construye un árbol, el algoritmo selecciona la mejor división en un nodo basado en todos los valores no-misos de la característica primaria (por ejemplo, “ingreso $50,000”). Luego busca una o más características surrogadas que mejor imitan que se dividen. Una división surrogada se define por una característica diferente (por ejemplo, “nivel educativo = graduado universitario”) que, cuando se utiliza en el subconjunto de datos donde se observa el ingreso
Ventajas y desventajas
[LT] El paquete de soporte de la FRANJE [LT] tiene la mayor ventaja de no requerir ninguna imputación: el árbol aprende de todos los datos disponibles sin fabricar valores. También conservan las relaciones condicionales aprendidas durante la construcción de árboles. Sin embargo, la técnica exige que algunas características correlativas existan para servir como sustitutos; si la característica falta no tiene correlaciones fuertes, las divisiones del árbol pueden perder precisión para las entradas perdidas.
Enfoques basados en modelos y algoritmos modernos
En los últimos años se ha observado el aumento de los marcos gradiente-boosting que incorporan el tratamiento de valor perdido directamente en el algoritmo de aprendizaje, a menudo superando tanto la imputación como las divisiones sustitutivas en el rendimiento predictivo.
XGBoost
XGBoost (Extreme Gradient Boosting) aprende cómo manejar los valores perdidos durante el entrenamiento tratando la falta de la señal como una escasa. En cada división, el algoritmo evalúa tanto una dirección predeterminada para los datos perdidos (niña izquierda o derecha) y el valor de separación óptimo en las entradas observadas.
LightGBM
LightGBM] toma una ruta diferente: trata valores cero y falta como un grupo único (por defecto) y optimiza la dirección dividida para ese grupo. Durante el entrenamiento, se aprende si las muestras faltantes pertenecen al niño izquierdo o derecho de una división. Como XGBoost, no requiere imputación y maneja datos escasos de manera eficiente.
CatBoost
CatBoost (Boost categórico) utiliza un mecanismo ligeramente diferente: trata los valores perdidos como una categoría separada y permite que el árbol decida cuándo dividirse en esa categoría. Para las características numéricas, los valores perdidos se asignan inicialmente a un marcador de posición (por ejemplo, −1) y el árbol encuentra una división óptima basada en ese tratamiento.
Aplicación de datos perdidos en la práctica
Elegir una estrategia depende del patrón de herramientas, tamaño de datos y falta de datos. A continuación se muestra un flujo de trabajo estructurado que integra las técnicas discutidas.
- Evaluar la falta] – calcular el porcentaje de valores perdidos por característica y por muestra. Si alguna característica tiene >90% desaparecido, considere dejarla a menos que el conocimiento de dominio sea fuerte. Visualizar correlaciones entre los indicadores de la pérdida y las características observadas utilizando una hoja de calor o una prueba de la χ2.
- ]Identificar el mecanismo] – aplicar la prueba de MCAR de Little si la muestra es lo suficientemente grande. Si el MCAR es plausible, la eliminación de listones puede ser aceptable para la pequeña falta ( cúlt;5%). Para MAR o MCAR con falta moderada, imputación o manipulación basada en modelos es más seguro. Para MNAR, considere la posibilidad de recoger datos adicionales o utilizar modelos de patrón.
- Seleccione un método basado en su marco:
- Si se utiliza árboles de decisión de esklearn (no se encuentra ningún soporte perdido), utilice un impútero (por ejemplo, o ) dentro de un y sintone la estrategia de imputación cruzada.
- Si se utiliza XGBoost/LightGBM/CatBoost, no es necesaria ninguna imputación, simplemente pasar los datos con valores; los marcos los manejarán. Esto es a menudo el enfoque más simple y eficaz.
- Si se utiliza R , active el parámetro para activar las divisiones de surrogativas.
- ]Híperparametros de tono que afectan la manipulación desaparecida] – para XGBoost, y pueden influir en las opciones de subdivisiones de valor desaparecido. Para CatBoost, controla cómo se tratan los valores numéricos desaparecidos (como clase o imputed).
- Validar adecuadamente] – siempre incluye el manejo de datos perdidos dentro de un bucle de validación cruzada (por ejemplo, imputación antes de la división de tren/test para evitar fugas de datos). Compare el rendimiento de diferentes métodos en los mismos pliegues para asegurar la significación estadística.
Mejores prácticas y saltos comunes
- No impute la variable de destino – imputing the target in a supervised context biases the learning signal. En lugar de ello, excluye o trata la falta de destino como un problema de modelado separado (por ejemplo, tratar como una clase adicional).
- Utilizar el conocimiento de dominio] – en muchos campos, la falta de sentido tiene un significado. Por ejemplo, una prueba de laboratorio que falta podría indicar que el médico no sospechaba una condición, proporcionando información útil. Algunas implementaciones de árboles le permiten crear una característica indicadora que falta explícitamente para dejar que el árbol se divida en la falta como una variable binaria.
- ]Tenga cuidado con datos escasos de alta dimensión – si la mayoría de las características tienen entradas frecuentes, la imputación puede llegar a ser muy incierta. En tales casos, utilice métodos basados en árboles con manejo integrado (XGBoost o LightGBM) que tratan a la desaparición como una dirección separada.
- Conjunto de modelos de imputación] – para aplicaciones críticas, considere utilizar múltiples imputaciones y promediar árboles de decisión a través de conjuntos de datos imputados (es decir, múltiples imputaciones + conjunto). Esto es computacionalmente pesado pero puede mejorar la robustez bajo MAR.
- El rendimiento de despliegue de los monitores: el patrón de faltas puede cambiar con el tiempo (concepte deriva). Seguir continuamente las características de las tasas de desaparición y los modelos de reentrenamiento con estrategias de manipulación actualizadas.
Conclusión
Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainbibliotecas. Los marcos de gradiente-boosting modernos – XGBoost, LightGBM y CatBoost – han establecido un nuevo estándar mediante el aprendizaje de direcciones óptimas de valor perdido extremo a extremo, a menudo dando una precisión predictiva superior sin ningún preprocesamiento. En última instancia, la mejor práctica es evaluar sistemáticamente varios métodos en un conjunto de validación, utilizando conocimientos de dominio para refinar la elección.
Más lectura: ]Missing Data – Wikipedia] cubre la teoría estadística; documentación de imputación de la ciencia proporciona detalles de implementación; y el tutorial de valor perdido [FLT] [FLT]] ofrece un código de ejemplo.