Table of Contents
El aprendizaje profundo ha alterado fundamentalmente el paisaje de la ingeniería, permitiendo a los sistemas detectar anomalías en la salud estructural, optimizar diseños aerodinámicos y predecir fallos de equipo antes de que ocurran. Su capacidad para aprender relaciones complejas y no lineales de datos brutos lo ha convertido en una herramienta indispensable en campos que van desde la ingeniería civil hasta el espacio y la fabricación.
Comprender la escasez de datos en ingeniería
La escasez de datos en contextos de ingeniería es raramente una cuestión simple de tener pocas muestras. Es un problema sistémico basado en la naturaleza de los sistemas de ingeniería, las limitaciones de despliegue real y el costo de obtener verdad terrestre. En muchas aplicaciones de ingeniería, la recopilación de datos se ve obstaculizada por limitaciones físicas, preocupaciones de seguridad y barreras patentadas. Por ejemplo, la captura de datos de falla para infraestructuras críticas como puentes, turbinas o aeronaves requiere años de funcionamiento poco frecuentes
Los siguientes factores contribuyen al problema de escasez de datos en la ingeniería:
- Acceso limitado a los datos propietarios: Las empresas de ingeniería tratan los datos operativos como propiedad intelectual. Compartir datos entre organizaciones, incluso para la investigación colaborativa, a menudo se ve restringido por preocupaciones jurídicas y competitivas, creando silos de datos aislados.
- Alto costo de etiquetado y anotación: A diferencia de los datasets de imagen a escala de Internet que pueden ser etiquetados mediante la captación de multitudes, los datos de ingeniería requieren experiencia de dominio. La etiquetación de una sola cansancio en un micrografo de metal de alta resolución puede requerir un metalurgist, y etiquetar señales de sensores dinámicos para la detección de fallas exige conocimiento de todo el sobre operativo del sistema.
- Eventos extremos o graves: Muchos modelos de aprendizaje profundo de ingeniería tienen como objetivo predecir fallos (por ejemplo, aumento de compresores en turbinas de gas, propagación de grietas en concreto) y son difíciles de reproducir bajo condiciones controladas, lo que da lugar a un desequilibrio grave de los conjuntos de datos.
- Limitaciones físicas y de seguridad: La realización de experimentos para generar más datos puede ser imposible debido a costos, tiempo o riesgo. Por ejemplo, los automóviles de pruebas de choque o la simulación de respuestas sismológicas en estructuras a gran escala no pueden hacerse a escala.
- Complejidad y no estacionalidad: Los sistemas de ingeniería suelen funcionar bajo condiciones variables (carga, temperatura, humedad). Un modelo formado en datos de una temporada o régimen operativo puede no generalizarse a otra, haciendo que los datos disponibles sean aún más espaciados cuando se estratifican por condiciones de operación.
Impactos de la escasez de datos en los modelos de aprendizaje profundo
Cuando los datos de entrenamiento son limitados, los modelos de aprendizaje profundo, especialmente los que tienen millones de parámetros, tienen impredeciblemente. Las consecuencias se extienden más allá de las métricas de precisión simples; afectan la seguridad, la robustez y la utilidad práctica del modelo en la toma de decisiones de ingeniería.
Superficie y Pobre Generalización
El exceso de ajuste ocurre cuando un modelo memoriza las muestras de entrenamiento en lugar de aprender los patrones subyacentes. Con datos escasos, la capacidad del modelo para sobrepalancar es amplificada. Un modelo de sobrepase puede lograr un rendimiento casi perfecto en el conjunto de entrenamiento, pero no catastróficamente en nuevos y no visibles entradas. En ingeniería, donde las decisiones a menudo implican sistemas críticos de seguridad, tal fracaso es inaceptable.
Incapacidad para aprender características robustas
El aprendizaje profundo prospera en las jerarquías de características de alta dimensión. Cuando los datos son escasos, el modelo no puede aprender de forma fiable las características discriminatorias. En cambio, recoge correlaciones espurias que suceden estar presentes en el conjunto de entrenamiento limitado, por ejemplo, asociando un color de fondo específico en una imagen infrarroja con un defecto de material, en lugar de la firma térmica real.
Predicción inferior Predicción Precisión y fiabilidad
Las métricas cuantitativas, como la precisión, el recuerdo y F1-score sufren cuando los datos son escasas. Lo más importante es que la calibración de confianza se vuelve inconfiable. Un modelo puede producir una puntuación de confianza alta incluso para predicciones erróneas, lo que lleva a los ingenieros a confiar en productos incorrectos. En aplicaciones como el mantenimiento predictivo, esto puede resultar en ventanas de mantenimiento o reemplazos innecesarios, ambos, ambos afectan directamente los costos operativos.
Aumento de la incertidumbre en la adopción de decisiones
La escasez de datos aumenta inherentemente la incertidumbre epistémica, la incertidumbre por falta de conocimiento sobre el modelo verdadero. Sin suficientes datos para limitar el espacio hipotesis del modelo, las predicciones se vuelven muy inciertas. Los ingenieros que confían en tales modelos de optimización del diseño o evaluación del riesgo se dejan con amplios intervalos de confianza que hacen que la salida sea prácticamente inútil.
Estrategias clave para superar la escasez de datos
A pesar de los desafíos, la comunidad de ingeniería de aprendizaje profundo ha desarrollado un robusto conjunto de herramientas para combatir la escasez de datos. Estas estrategias van desde enfoques puramente centrados en datos (aumentación, generación sintética) hasta algoritmos centrados (modelo de transmisión, modelos de información física).Las soluciones más eficaces a menudo combinan múltiples técnicas en un oleoducto a medida.
Aumentación de datos para dominios de ingeniería
El aumento de datos aumenta artificialmente el entrenamiento mediante la aplicación de transformaciones a muestras existentes mientras preserva las etiquetas.En tareas de ingeniería basadas en imágenes (por ejemplo, detección de grietas en hormigón, clasificación de defectos en superficies metálicas), aumentaciones estándar incluyen rotaciones aleatorias, volteretas, brillo y ajustes de contraste, y la inyección de ruido Gaussiano.
Transferencia de aprendizaje y adaptación de dominio
El aprendizaje de transferencia aprovecha un modelo pre-entrenado en un conjunto de datos de fuentes grandes y relacionados y lo ajusta en el conjunto de datos de ingeniería de destino pequeño. En la visión de la computadora, las redes pre-entrenadas de ImageNet se han adaptado con éxito para detectar defectos en hojas de turbina o cracks de dominio en puentes con tan sólo 100 imágenes etiquetadas.
Generación de datos sintéticos a través de Simulación y GAN
Cuando los datos reales son escasos, los datos sintéticos pueden generarse mediante simulaciones basadas en la física o modelos de aprendizaje profundo generativos. Los modelos de elementos finitos de alta fidelidad, dinámicas de fluidos computacionales (CFD) y software de dinámica multicuerpo pueden producir datos etiquetados para casi cualquier escenario de ingeniería, desde distribuciones de estrés hasta coeficientes aerodinámicos.
Redes neuronales informadas de Física (PINNs)
Los datos de la física se pueden aplicar mediante la prevención de los efectos secundarios de los materiales.Los datos de la física se pueden aplicar con precisión en el campo de la pérdida.
Aprendizaje de pocas imágenes y meta-aprendizaje
El aprendizaje de poca monta (FSL) tiene como objetivo formar modelos que pueden generalizarse de un puñado de ejemplos por clase. El aprendizaje de fallas de la serie de microprocesamientos puede ser utilizado por un modelo de precisión de la serie de errores de la serie 2022.
Compartir datos y aprender federado
Los datos de la empresa no son absolutos, pero cada entidad tiene un conjunto de datos pequeño y privado que, cuando se combina, sería suficiente para formar modelos robustos.El intercambio de datos colaborativo, regulado por acuerdos de uso de datos, puede agregar muestras de múltiples sitios, instalaciones o empresas. Por ejemplo, modelos de mantenimiento predictivos para turbinas eólicas pueden beneficiarse de los datos de vibración recogidos en múltiples granjas eólicas.
Enfoques híbridos y conjuntos
A menudo, ninguna técnica basta. Combinar métodos, como el uso de la mejora de datos para ampliar un conjunto de datos real pequeño, luego agregar una regularización informada por física durante la formación, y rendimientos resultados más fuertes. Ensemble el aprendizaje, donde se combinan múltiples modelos de ingeniería en diferentes subconjuntos o con diferentes arquitecturas, también puede mitigar la diferencia causada por datos de escaso.
Conclusión
La escasez de datos sigue siendo un desafío formidable para el aprendizaje profundo en aplicaciones de ingeniería, pero no es insuperable. El amplio espectro de estrategias —que abarcan desde la intensificación de los datos y la transferencia de aprendizaje a redes neuronales de datos de datos desaceleradas y la colaboración de datos— proporciona a los ingenieros un rico ecosistema de herramientas para crear modelos eficaces incluso cuando los datos sean limitados.