Table of Contents
Los sistemas de adquisición de datos (DAS) son la columna vertebral de la vigilancia industrial, la investigación científica y el control automatizado de procesos. Convierten fenómenos físicos como la temperatura, presión, vibración y voltaje en datos digitales para el análisis y toma de decisiones.En entornos críticos de misión, que se desplazan desde centrales nucleares y fabricación farmacéutica a pruebas aeroespaciales y refinerías de petróleo, un solo punto de fracaso puede causar pérdida de datos catastróficos, condiciones de funcionamiento inseguras, o una adquisición.
Comprender la Redundancia en los sistemas de adquisición de datos
La redecuancia, en el contexto de un DAS, significa duplicar componentes o funciones esenciales para que el sistema pueda seguir funcionando —o al menos fracasar con gracia— cuando un componente falla. El objetivo es eliminar puntos únicos de fracaso y mantener la integridad, continuidad y disponibilidad de datos. La redefinición puede aplicarse en múltiples niveles: hardware, datos, red e incluso software.
Hardware Redundancia
La redundancia de hardware implica duplicar componentes físicos como sensores, acondicionadores de señales, convertidores analógicos a dígitos (ADCs), controladores, suministros de energía y dispositivos de almacenamiento.
- N+1 Redundancia: Se añade un componente adicional al número mínimo requerido (por ejemplo, tres fuentes de alimentación para un sistema que sólo necesita dos). Si uno falla, el resto sigue suministrando carga completa.
- ]Hot Standby: Una unidad secundaria funciona en paralelo con la primaria. La reserva monitorea continuamente la salida de la primaria y se hace cargo de la interrupción cero o mínima al fracaso. Esto es común para los controladores y los registradores de datos de alta velocidad.
- Cold Standby: Un componente de repuesto se mantiene fuera de línea y sólo se activa cuando se detecta un fallo. Este enfoque es menos costoso pero presenta un breve retraso durante la falla.
- Voto de los sensores (Triple Modular Redundancia): Tres sensores idénticos miden el mismo parámetro; el sistema compara los productos y descarta cualquier que se desvíe. El valor medio o mayoritario se utiliza. Esta técnica se utiliza ampliamente en la aviación y la instrumentación nuclear (véase ]Triple Redundancia modular.
La selección del nivel adecuado de redundancia de hardware depende de la importancia crítica de la medición, el tiempo medio entre fallos (MTBF) de componentes y limitaciones presupuestarias. Por ejemplo, un sistema de control de temperatura en un reactor químico puede justificar la triple redundancia para el sensor de seguridad primario, mientras que un medidor de flujo no crítico sólo puede requerir una unidad de repuesto en el estante.
Rendición de datos y fiabilidad de almacenamiento
La redundancia de datos asegura que las valiosas mediciones capturadas por un DAS no se pierdan si un dispositivo de almacenamiento falla.
- Configuraciones de ARID: RAID 1 (esmirretirada) escribe datos idénticos a dos o más discos simultáneamente. Si un disco falla, el sistema continúa operando desde el espejo. RAID 5 o 6 proporciona un equilibrio de rendimiento y tolerancia a la falla mediante la desnivela de paridad.
- Duplicación de datos locales y remotos:] Los flujos de datos críticos se copian a una unidad local secundaria (por ejemplo, una SSD) y se transmiten simultáneamente a un servidor remoto o respaldo en la nube. Esto protege contra daños físicos, robos o pérdida de energía en todo el sitio.
- Arranque de bordes: El DAS industrial suele escribir datos a dos registradores independientes. Si un logger falla, el segundo continúa ininterrumpido. Esto es común en los registros de datos de vuelo y los sistemas de monitoreo continuo de emisiones (CEMS).
La redundancia de datos también debe tener en cuenta la integridad de los datos. Técnicas como las sumas de comprobación y los controles de redundancia cíclica (CRC) verifican que los datos almacenados no han sido dañados. Para más información sobre las mejores prácticas de almacenamiento de datos, consulte la Guía de instrumentos nacionales sobre el almacenamiento de datos.
Redundancia de redes
En sistemas de adquisición de datos distribuidos, múltiples sensores y controladores se comunican a través de una red. Un solo cable de rotura o fallo de conmutación puede aislar toda una zona.
- Senderos físicos múltiples: Usando dos o más rutas de cable independientes (por ejemplo, Ethernet cableado y fibra óptica) para conectar los mismos puntos de final. Si se corta un camino, el tráfico se desvía automáticamente.
- Cambios y Routers: Implementación de interruptores de red dual configurados en una topología de anillos usando protocolos como el Protocolo de Árbol de Spanning Rapid (RSTP) o el Protocolo de Redundancia Media (MRP).
- Enlaces de respaldo ininterrumpido: En DAS remoto o móvil, un enlace celular o satélite puede servir como respaldo cuando la conexión cableada primaria falla.
- Redundancia de nivel de protocolo: Usar protocolos Ethernet industriales como EtherNet/IP con anillo de nivel de dispositivo (DLR) o PROFINET con redundancia de medios para una falla sin problemas.
La redundancia de la red es especialmente crítica en los sistemas SCADA (Control de Supervisión y Adquisición de Datos) donde los datos en tiempo real de cientos de unidades terminales remotas (RTUs) deben llegar a la sala central de control sin interrupción.
Características Fail-Safe en los sistemas de adquisición de datos
Un sistema de seguridad de fallos está diseñado para asegurar que un fracaso no lleve a consecuencias inseguras. En lugar de seguir operando de manera impredecible, el sistema transfiere a un estado seguro predefinido. Las características de seguridad de la energía fáil protegen al personal, el equipo y la integridad de los datos.
Cierre automático y parada de emergencia
Cuando se detecta una falla crítica, como una lectura de sensores fuera de los parámetros seguros, un reloj de control de control o una pérdida de comunicación, el sistema debe iniciar automáticamente una secuencia de cierre seguro. Esto puede implicar motores des-energizantes, válvulas de cierre o fuentes de energía de aislamiento. La lógica de apagado debe ser duramente a través de la pantalla de control, siempre que sea posible para evitar confiar en software que podría haber fallado.
Notificación y Anunciación de Alarmas
Los sistemas de seguridad de la energía fáil deben alertar a los operadores rápidamente.
- Alarmas visuales: Luces de inflexión, pop-ups de HMI y pantallas de estado.
- Armas audibles: Sirens, cuernos, o anuncios de voz.
- Remote Notifications: Correos electrónicos, SMS o llamadas telefónicas automatizadas a personal fuera de la página.
- Logging: Todas las alarmas deben ser selladas y almacenadas en un registro no volátil para el análisis posterior a los eventos.
Las normas de gestión de alarmas como ISA-18.2 o EEMUA-191 proporcionan marcos para evitar la fatiga por alarma priorizando y suprimiendo alarmas de molestia.
Graceful Degradation
No todo fallo justifica un cierre completo del sistema. La degradación grata permite que el DAS siga operando a una capacidad reducida mientras mantiene la seguridad. Por ejemplo:
- Si uno de los tres sensores de temperatura redundantes falla, el sistema utiliza el promedio de los dos restantes y registra el estado degradado.
- Si un enlace de datos de ancho de banda alto baja, el registrador local almacena datos localmente hasta que el enlace se restablezca.
- Si un módulo de alimentación falla, los módulos restantes pueden no ser capaces de soportar todos los sensores, por lo que el sistema prioriza las mediciones esenciales y desactiva los canales no críticos.
La aplicación de la degradación graciosa requiere un análisis cuidadoso de los riesgos y reglas claras de priorización definidas durante el diseño del sistema.
Relojes de reloj Timers y monitorización de latidos cardíacos
Un temporizador de reloj (WDT) es un contador de hardware o software que supervisa la ejecución correcta del bucle de control principal. La aplicación se reinicia periódicamente el temporizador. Si la aplicación se congela o se bloquea, el temporizador expira y activa un sistema de reajuste o acción insegura. Muchos microcontroladores y PLCs han incorporado WDTs. En sistemas distribuidos, se envía un mensaje de pulso entre el controlador de error de la arquitectura principal
Validación de datos y corrección de errores
Las características de seguridad de la falla no se limitan al hardware, sino que también incluyen controles de software que validan los datos de entrada antes de que se use para el control o la tala de bitácora.
- Range Checks: Rechazar lecturas que caen fuera de límites físicos plausibles (por ejemplo, una temperatura de –300°C).
- Comprobaciones de código: Lecturas de bandera que cambian más rápido que físicamente posible, lo que puede indicar una falla de sensor o un problema de cableado.
- Validación de canal de escoria: Compare las mediciones redundantes entre sí. Si difieren más allá de una tolerancia, el sistema marca una inconsistencia.
- Códigos de Corrección Error (ECC):] Se utiliza en protocolos de memoria y comunicación para detectar y corregir errores de un solo bit.
Para más información sobre la validación de datos en la instrumentación industrial, consulte la Omega Guía de ingeniería para el diseño del sistema de adquisición de datos.
Consideraciones de diseño para Redundant y Fail-Safe DAS
La construcción de un DAS robusto comienza mucho antes de que se tire el alambre. Requiere un enfoque sistemático que incluya el modo de falla y el análisis de efectos (FMEA), la selección de arquitectura y la planificación del ciclo de vida.
Análisis de los efectos y el modo de falla (FMEA)
FMEA es un método estructurado para identificar todas las formas posibles que un componente o subsistema puede fallar y evaluar el impacto de cada fallo. Por ejemplo, un FMEA podría revelar que un único suministro de energía es el mayor riesgo, lo que provoca la adición de una configuración N+1.
Selección de Arquitectura de la Redundancia
Hay varias arquitecturas clásicas, cada una con intercambios:
- 1+1 (Duplex) Redundancia: Dos unidades idénticas, una activa, una reserva. Costo simple pero doble de hardware. Se utiliza para controladores críticos y registradores de datos.
- 2 de-3 Voting (TMR): Tres unidades con voto mayoritario. Proporciona una tolerancia de alta falla pero triples coste. Común en sistemas de seguridad (SIL 3/4).
- M-of-N Redundancy: Más general: el sistema funciona siempre y cuando por lo menos M fuera de las unidades N sean funcionales. Por ejemplo, tres de cada cuatro bombas deben trabajar para mantener el flujo.
- Cold vs. Hot Standby: El soporte caliente requiere el ancho de banda de poder continuo y comunicación, pero produce una falla casi instancial. La reserva fría es más barata, pero presenta un retraso y puede requerir intervención.
La elección depende de la disponibilidad necesaria, el nivel de integridad de seguridad (SIL) y el presupuesto.
Redundancia del sistema de energía
La energía es el punto de falla más común en DAS. Unidades de suministro de energía de redundant (PSUs) con circuitos de transferencia de energía o de carga evitan que una sola falla de PSU derriba el sistema. ]Los suministros de energía ininterrumpida (UPS) proporcionan una copia de seguridad de la batería para los cortos, mientras que los generadores manejan el panel de baterías prolongado.
Environmental and Physical Protection
La redecencia no significa nada si un evento inundado, fuego o sísmico saca tanto la primaria como la copia de seguridad.
- Colocar los registradores de datos críticos en recintos separados o incluso habitaciones separadas.
- Ruta cables de red redundantes a través de diferentes caminos físicos (por ejemplo, metro vs. sobrecabeza).
- Use conectores resistentes a la corrosión y revestimientos conformales en tableros de circuitos en entornos duros.
- Instale protectores de onda y barreras de aislamiento en todas las líneas I/O para evitar que se propagan daños de rayo o lazo de tierra.
Para entornos industriales duros, consulte el artículo de dispositivos análog sobre la adquisición de datos en entornos difíciles.
Pruebas y mantenimiento de la redundancia y las características de la muerte fáil
Un sistema redundante que nunca ha sido probado no es redundante, es una salvaguardia teórica. Las pruebas regulares verifican que las fallas funcionan y que las alarmas se activan correctamente.
Previstos perforaciones de failover
Programa las interrupciones periódicas de los componentes individuales (por ejemplo, la toma del enchufe en el controlador primario) para observar el comportamiento de la falla. El sistema debe cambiar sin problemas a la reserva, y el evento debe ser registrado. Después de la prueba, el desvío manual debe ser realizado para volver a la operación normal. Documenta los resultados y ajuste los umbrales o temporizadores según sea necesario.
Auto-Test (BIST)
Los componentes DAS modernos suelen incluir BIST que se ejecutan al inicio y periódicamente durante el funcionamiento. Por ejemplo, una fuente de alimentación redundante puede probar su regulación de salida e informar de cualquier deriva. Un sensor inteligente puede ejecutar un ciclo de diagnóstico que comprueba su tensión de referencia interna. Los resultados BIST deben ser centralizados y alarmados.
Actualizaciones de software y software
La lógica de la Redundancia se aplica a menudo en firmware. Cuando las actualizaciones son publicadas por el fabricante, deben ser probadas en un entorno de estadificación antes de implementarse en sistemas de producción.
Logros de mantenimiento y gestión del ciclo de vida
Cada componente redundante tiene una vida útil finita. Rastrea los datos MTBF y sustitúyalos de forma proactiva, especialmente condensadores electrolíticos en suministros de energía y baterías en unidades UPS. Un DAS bien mantenido con pruebas de redundancia documentadas tendrá mayor disponibilidad y menos interrupciones no planificadas.
Ejemplos prácticos de la Redundancia y la aplicación Fail-Safe
Ejemplo 1: Estación de vigilancia del medio ambiente remota
Una estación de tiempo en una remota ubicación de montaña utiliza un DAS para registrar la temperatura, humedad, velocidad del viento y radiación solar. La estación está alimentada por un panel solar y la batería. La redundancia se implementa de la siguiente manera:
- Dos sensores de temperatura independientes (PT100 RTD) a diferentes alturas.
- Un módem celular de respaldo que se activa cuando el enlace de satélite primario falla.
- Tarjetas de microSD duales en el registrador de datos: si una tarjeta falla, los datos continúan hasta el segundo.
- El monitoreo de voltaje de batería activa un modo de baja potencia que suspende mediciones no esenciales (por ejemplo, radiación solar) para extender la vida de la batería.
Ejemplo 2: Proceso de Blending Farmacéutico continuo
Una planta farmacéutica mezcla ingredientes activos utilizando un DAS regulado. Los requisitos de seguridad exigen el cumplimiento SIL 2.
- Triple redundancia modular (2o3) para sensores de presión y temperatura críticos en el recipiente de reacción.
- PLCs Redundant con reserva caliente: la copia de seguridad toma el control dentro de 50 ms si la primaria falla.
- Relés de cierre de emergencia con cable de cierre que cierran válvulas y ventosas abiertas si la temperatura del reactor excede un límite seguro o si la comunicación con el DAS se pierde por más de 200 ms.
- Escalada de alarma: cuerno local primero, luego los pólizas para el supervisor de turno, y si no se reconoce dentro de 2 minutos, llamada automática al gerente de planta.
Ejemplo 3: Monitoreo de vibración de alta velocidad para Turbines
En una planta de generación de energía, un DAS de alta velocidad (10 kHz por canal) monitorea vibraciones en una turbina de gas. La pérdida de monitoreo podría conducir a fallas catastróficas de la hoja.
- Dos acelerómetros independientes por cojinete (cada uno con su propio acondicionador de señal y ADC).
- Concentradores de datos redundantes duales con una falla determinista utilizando una red de anillos.
- RAID 1 almacenamiento SSD en la unidad DAS principal y un paralelo escribe a un servidor historiador sobre una red separada.
- Un temporizador de relojes que dispara una alarma si el DAS deja de enviar pulsos de latidos cardíacos al sistema de control de la turbina durante más de un segundo.
Resumen de las mejores prácticas
Para concluir, aquí se encuentra un conjunto consolidado de mejores prácticas para incorporar las funciones de redundancia y seguridad en el sistema de adquisición de datos:
- Empieza con un análisis minucioso de los modos de falla (FMEA)] para identificar los puntos de falla más críticos antes de seleccionar cualquier esquema de redundancia.
- Utilice un enfoque escalonado: combina hardware, datos y redundancia de red para cubrir múltiples escenarios de falla simultáneamente.
- Describe todas las acciones de seguridad de fallos para ser “de-energizadas para viajar” de modo que la pérdida de energía conduce al sistema a un estado seguro en lugar de dejarlo en una condición indeterminada.
- Implement automatic failover only after extensive testing] para asegurar que la copia de seguridad pueda asumir la carga sin introducir inestabilidad.
- Nunca se fije en una sola vía de alarma—retroducir notificaciones audibles, visuales y remotas de forma independiente.
- Componentes redundantes supuestamente separados para proteger contra los desastres ambientales.
- Conducir ejercicios de failover regulares e incluirlos en la formación de operadores.
- Monitor la salud de subsistemas redundantes] (por ejemplo, tensión de alimentación, carga de batería, datos de disco SMART) y sustituir proactivamente las piezas de envejecimiento.
- Documentar toda la redundancia y lógica insegura en un manual de diseño de sistema para ayudar a solucionar problemas y actualizar futuros.
Al seguir estas prácticas, los ingenieros pueden construir sistemas de adquisición de datos que no sólo recopilan datos de manera fiable sino que también resisten los inevitables fracasos que ocurren en entornos industriales y científicos del mundo real. La inversión en redundancia y diseño seguro de fallos se paga por sí mismo en tiempos de inactividad evitados, reducción de los riesgos de seguridad y preservación de la integridad de los datos, haciendo que el sistema sea realmente resistente.