Table of Contents
Dans les environnements critiques de la mission, allant des centrales nucléaires et de la fabrication pharmaceutique aux essais aérospatiaux et aux raffineries de pétrole, un seul point de défaillance peut causer une perte catastrophique de données, des conditions d'exploitation dangereuses ou des temps d'arrêt prolongés. L'acquisition de la résilience dans un DAS par redondance intentionnelle et des caractéristiques de sécurité en cas de défaillance n'est donc pas facultative; c'est une exigence fondamentale de conception. Cet article explore les stratégies architecturales, les méthodes de mise en œuvre et les meilleures pratiques pour créer un système d'acquisition de données qui demeure opérationnel et sûr même lorsque les composants échouent.
Comprendre la redondance dans les systèmes d'acquisition de données
La redondance, dans le contexte d'un DAS, signifie la duplication de composants ou de fonctions critiques afin que le système puisse continuer à fonctionner – ou du moins échouer gracieusement – lorsqu'un composant échoue. L'objectif est d'éliminer les points uniques de défaillance et de maintenir l'intégrité, la continuité et la disponibilité des données.
Redondance matérielle
La redondance matérielle implique la duplication de composants physiques tels que capteurs, conditionneurs de signaux, convertisseurs analogiques à numériques (ADC), contrôleurs, alimentations et dispositifs de stockage.
- N+1 Redundancy: Un composant supplémentaire est ajouté au nombre minimum requis (p. ex. trois alimentations pour un système qui n'a besoin que de deux). Si un seul échoue, le reste continue d'alimenter la pleine charge.
- Hot Standby:[ Une unité secondaire fonctionne en parallèle avec le primaire. Le standby surveille en permanence la sortie primaire et prend le relais avec une interruption zéro ou minimale en cas de défaillance. Ceci est courant pour les contrôleurs et les enregistreurs de données à grande vitesse.
- Cold Standby:[ Un composant de rechange est maintenu hors ligne et ne s'active que lorsqu'une défaillance est détectée. Cette approche est moins coûteuse mais introduit un bref délai pendant la panne.
- Sensor Voting (Triple Modular Redundancy):[ Trois capteurs identiques mesurent le même paramètre; le système compare les sorties et rejette toute déviation. La valeur médiane ou la majorité est utilisée. Cette technique est largement utilisée dans l'aviation et l'instrumentation nucléaire (voir Triple Modular Redundancy.
Le choix du bon niveau de redondance matérielle dépend de la criticité de la mesure, du temps moyen entre les défaillances des composants et des contraintes budgétaires. Par exemple, un système de surveillance de la température dans un réacteur chimique peut justifier une triple redondance pour le capteur de sécurité primaire, tandis qu'un débitmètre non critique peut seulement nécessiter une unité de rechange sur l'étagère.
Redondance des données et fiabilité du stockage
La redondance des données permet de garantir que les mesures précieuses saisies par un DAS ne sont pas perdues en cas de défaillance d'un dispositif de stockage.
- Configurations RAID: RAID 1 (miroir) écrit des données identiques à deux disques ou plus simultanément. Si un disque échoue, le système continue à fonctionner depuis le miroir. RAID 5 ou 6 fournit un équilibre de performance et de tolérance de défaut par le biais du striping par parité.
- Dupplication des données locales et distantes:[ Les flux de données critiques sont copiés sur un disque local secondaire (p. ex., un SSD) et transmis simultanément à un serveur distant ou à une sauvegarde cloud.
- Logage redondant: Le DAS industriel écrit souvent des données à deux enregistreurs indépendants. Si un enregistreur échoue, le second continue sans interruption. Ceci est courant dans les enregistreurs de données de vol et les systèmes de surveillance continue des émissions (CEMS).
Les techniques telles que les contrôles de contrôle et les contrôles cycliques de redondance (CRC) vérifient que les données stockées n'ont pas été corrompues. Pour plus d'informations sur les meilleures pratiques de stockage des données, voir le .
Redondance réseau
Dans les systèmes d'acquisition de données distribués, plusieurs capteurs et contrôleurs communiquent sur un réseau. Une rupture de câble ou une défaillance de commutateur unique peut isoler une zone entière.
- Paths physiques multiples:[ En utilisant deux ou plusieurs voies de câbles indépendantes (p. ex. Ethernet filaire et fibre optique) pour connecter les mêmes paramètres. Si un chemin est coupé, le trafic se réachemine automatiquement.
- Commutateurs et routeurs redondants: Déployer des commutateurs réseau doubles configurés dans une topologie de bague en utilisant des protocoles comme Rapid Spanning Tree Protocol (RSTP) ou Media Redundancy Protocol (MRP).
- Dans le DAS à distance ou mobile, une liaison cellulaire ou satellite peut servir de sauvegarde lorsque la connexion filaire primaire échoue.
- Redondance de niveau de protocole:[ Utilisation de protocoles Ethernet industriels tels que EtherNet/IP avec bague de niveau de périphérique (DLR) ou PROFINET avec redondance de médias pour une panne sans soudure.
La redondance réseau est particulièrement critique dans les systèmes SCADA (Supervisory Control and Data Acquisition) où les données en temps réel de centaines d'unités terminales distantes (RTU) doivent atteindre la salle de contrôle centrale sans interruption.
Caractéristiques de sécurité en cas d'échec dans les systèmes d'acquisition de données
Un système de sécurité en cas d'échec est conçu pour s'assurer qu'une défaillance n'entraîne pas de conséquences dangereuses. Au lieu de continuer à fonctionner de manière imprévisible, le système passe à un état de sécurité prédéfini.
Arrêt automatique et arrêt d'urgence
Lorsqu'une faille critique est détectée, comme une lecture de capteur à l'extérieur des paramètres de sécurité, un délai de contrôle ou une perte de communication, le système devrait automatiquement déclencher une séquence d'arrêt sécuritaire, ce qui peut impliquer la désenclenchement des moteurs, la fermeture des vannes ou l'isolement des sources d'énergie. La logique d'arrêt devrait être câblée (basée sur les relais) chaque fois que possible pour éviter de se fier à un logiciel qui aurait pu échouer.
Notification d'alarme et dénonciation
Les systèmes de sécurité des pannes doivent alerter rapidement les opérateurs.
- Alertes visuelles: Feux clignotants, pop-ups HMI et affichages d'état.
- Alertes sonores: Sirènes, cornes ou annonces vocales.
- Notifications à distance : Courriels, SMS ou appels téléphoniques automatisés à des employés hors site.
- Logage: Toutes les alarmes doivent être horodatées et stockées dans un journal non volatil pour analyse post-événement.
Les normes de gestion des alarmes telles que ISA-18.2 ou EEMUA-191 fournissent des cadres pour éviter la fatigue des alarmes en priorisant et en supprimant les alarmes nuisibles.
Dégradation gracieuse
Chaque défaillance ne justifie pas un arrêt complet du système. Une dégradation gracieuse permet au DAS de continuer à fonctionner à une capacité réduite tout en maintenant la sécurité.
- Si l'un des trois capteurs de température redondants échoue, le système utilise la moyenne des deux autres et enregistre l'état dégradé.
- Si un lien de données à large bande tombe, le logger local tamponne les données localement jusqu'à ce que le lien soit rétabli.
- Si un module d'alimentation électrique échoue, les modules restants ne pourront peut-être pas supporter tous les capteurs, de sorte que le système priorise les mesures essentielles et désactive les canaux non critiques.
La mise en œuvre d'une dégradation gracieuse nécessite une analyse minutieuse des risques et des règles de priorité claires définies lors de la conception du système.
Chronomètres de surveillance et surveillance des battements de coeur
Un minuteur de veille (WDT) est un compteur de matériel ou de logiciel qui supervise l'exécution correcte de la boucle de commande principale. L'application réinitialise périodiquement le minuteur. Si l'application se fige ou s'écrase, le minuteur expire et déclenche une réinitialisation ou une action de sécurité. De nombreux microcontrôleurs et PLC ont intégré des WDT. Dans les systèmes distribués, un message de battement de cœur est envoyé entre les contrôleurs primaires et de bascule; si le contrôleur de déroutement manque plusieurs battements de cœur, il assume le contrôle.
Validation des données et correction d'erreur
Les caractéristiques de sécurité des pannes ne se limitent pas au matériel, mais comprennent également des vérifications logicielles qui valident les données reçues avant qu'elles ne soient utilisées pour le contrôle ou l'enregistrement.
- Vérifications de portée:[ Rejeter les valeurs qui tombent en dehors des limites physiquement plausibles (p. ex., une température de –300°C).
- Checks de taux de changement:[ Les relevés d'affichage qui changent plus rapidement que physiquement, ce qui peut indiquer une défaillance du capteur ou un problème de câblage.
- Validation de la chaîne de corrosion:[ Comparer les mesures redondantes entre elles. S'il y a des différences au-delà d'une tolérance, le système signale une incohérence.
- [FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][F][F][FLT][F][
Pour en savoir plus sur la validation des données dans les instruments industriels, voir le Omega Engineering Guide to data acquisition system design.
Considérations de conception pour les SAD redondants et sûrs
La construction d'un DAS robuste commence bien avant l'extraction du fil. Il faut une approche systématique qui comprend le mode de défaillance et l'analyse des effets (FMEA), la sélection de l'architecture et la planification du cycle de vie.
Analyse du mode et des effets de défaillance (FMEA)
FMEA est une méthode structurée permettant d'identifier toutes les façons possibles de faire échouer un composant ou un sous-système et d'évaluer l'impact de chaque défaillance. Pour chaque mode de défaillance, les ingénieurs attribuent une cote de gravité, d'occurrence et de détection. Le guide des résultats permet de déterminer les caractéristiques de redondance et de sécurité les plus nécessaires.
Sélection d'architecture de redondance
Il existe plusieurs architectures classiques, chacune avec des compromis :
- 1+1 (Duplex) Redundancy: Deux unités identiques, une active, une en attente. Simple mais double le coût matériel. Utilisé pour les contrôleurs critiques et les enregistreurs de données.
- 2-de-3 Vote (TMR):[ Trois unités avec vote majoritaire. Fournit une tolérance élevée à la faute mais triple le coût.
- Radondance en M-de-N:[ Plus général : le système fonctionne aussi longtemps qu'au moins M des unités N sont fonctionnelles.Par exemple, trois pompes sur quatre doivent fonctionner pour maintenir le débit.
- Cold vs. Hot Standby:[ Hot standby nécessite une puissance et une largeur de bande de communication continues, mais donne une panne quasi instantanée.
Le choix dépend de la disponibilité requise, du niveau d'intégrité de sécurité (SIL) et du budget.
Redondance du système d'alimentation
Les unités d'alimentation redondantes (USP) avec circuits de partage de diodes OU ou de charge empêchent une seule défaillance de l'USP de faire tomber le système. Les alimentations non interruptibles (UPS) fournissent une sauvegarde de la batterie pour les pannes courtes, tandis que les générateurs gèrent des temps d'arrêt prolongés. Pour les stations éloignées critiques, des panneaux solaires avec des batteries ou des piles à combustible peuvent être utilisés.
Protection de l'environnement et de la santé
La redondance ne signifie rien si un événement d'inondation, d'incendie ou de sismique enlève à la fois la principale et la sauvegarde.
- Placez les enregistreurs de données critiques dans des boîtiers séparés ou même dans des pièces séparées.
- Router les câbles réseau redondants par différents chemins physiques (p. ex., souterrains ou aériens).
- Utilisez des connecteurs résistant à la corrosion et un revêtement conforme sur les circuits dans des environnements difficiles.
- Installez des protecteurs de surtension et des barrières d'isolement sur toutes les lignes d'entrée/sortie pour empêcher la propagation des dommages causés par la foudre ou la boucle au sol.
Pour les environnements industriels difficiles, reportez-vous à l'article Analog Devices sur l'acquisition de données dans des environnements difficiles.
Essai et entretien des caractéristiques de redondance et de sécurité des défaillances
Un système redondant qui n'a jamais été testé n'est pas redondant, c'est une sauvegarde théorique. Les tests réguliers vérifient que la panne fonctionne et que les alarmes sont déclenchées correctement.
Exercices d'échec prévus
Planifiez des arrêts périodiques de composants individuels (p. ex., tirer la fiche sur le contrôleur primaire) pour observer le comportement de la panne. Le système devrait passer en mode veille sans heurts et l'événement devrait être enregistré. Après le test, la panne manuelle devrait être effectuée pour revenir à un fonctionnement normal. Documenter les résultats et ajuster les seuils ou les minuteries au besoin.
Auto-essai intégré (BIST)
Les composants modernes DAS incluent souvent le BIST qui fonctionne au démarrage et périodiquement pendant le fonctionnement. Par exemple, une alimentation redondante peut tester sa régulation de sortie et signaler toute dérive. Un capteur intelligent peut exécuter un cycle de diagnostic qui vérifie sa tension de référence interne.
Mises à jour du logiciel et du firmware
La logique de redondance est souvent mise en œuvre dans le firmware. Lorsque les mises à jour sont publiées par le fabricant, elles doivent être testées dans un environnement de mise en scène avant le déploiement sur les systèmes de production.
Registres d'entretien et gestion du cycle de vie
Chaque composant redondant a une durée de vie limitée. Suivez les données MBBF et remplacez les composants de manière proactive, en particulier les condensateurs électrolytiques dans les alimentations et les batteries des unités UPS.
Exemples pratiques de redondance et de mise en œuvre sans risque
Exemple 1 : Station de surveillance environnementale à distance
Une station météorologique située dans une montagne éloignée utilise un DAS pour enregistrer la température, l'humidité, la vitesse du vent et le rayonnement solaire. La station est alimentée par un panneau solaire et une batterie.
- Deux capteurs de température indépendants (PT100 RT) à différentes hauteurs.
- Un modem cellulaire de secours qui s'active lorsque la liaison satellite principale échoue.
- Double carte microSD dans le enregistreur de données – si une carte échoue, les données continuent jusqu'à la seconde.
- La surveillance de la tension de la batterie déclenche un mode de sécurité de faible puissance qui suspend les mesures non essentielles (p. ex., le rayonnement solaire) pour prolonger la durée de vie de la batterie.
Exemple 2 : Procédé de mélange continu de produits pharmaceutiques
Une usine pharmaceutique mélange des ingrédients actifs en utilisant un DAS réglementé. Les exigences de sécurité exigent la conformité SIL 2.
- Redondance modulaire triple (2oo3) pour les capteurs de pression critique et de température dans le récipient de réaction.
- Les PLC redondants avec un courant de veille chaud – la sauvegarde prend le dessus dans les 50 ms si la primaire échoue.
- Les relais d'arrêt d'urgence à fils durs qui ferment les vannes et ouvrent les évents si la température du réacteur dépasse une limite de sécurité ou si la communication avec le DAS est perdue pendant plus de 200 ms.
- Accélération de l'alarme : d'abord le klaxon local, puis les téléphonistes pour le superviseur de quart, et si ce n'est pas reconnu dans les 2 minutes, appel automatique au gestionnaire de l'usine.
Exemple 3: Surveillance des vibrations à grande vitesse pour les turbines
Dans une centrale électrique, un DAS à grande vitesse (10 kHz par canal) surveille les vibrations portant sur une turbine à gaz. La perte de surveillance pourrait entraîner une défaillance catastrophique de la pale.
- Deux accéléromètres indépendants par roulement (chacun avec son propre conditionneur de signal et ADC).
- Double concentrateur redondant de données avec un décrochage déterministe utilisant un réseau à anneaux.
- RAID 1 Stockage SSD dans l'unité principale DAS et un écriture parallèle à un serveur historien sur un réseau séparé.
- Une minuterie de chien de garde qui déclenche une alarme si le DAS cesse d'envoyer des impulsions de battement cardiaque au système de commande de turbine pendant plus d'une seconde.
Résumé des pratiques exemplaires
Pour conclure, voici un ensemble de bonnes pratiques pour intégrer les fonctions de redondance et de sécurité d'échec dans un système d'acquisition de données:
- Démarrer par une analyse approfondie des modes de défaillance (FMEA) pour identifier les points de défaillance les plus critiques avant de choisir un système de redondance.
- Utiliser une approche en couches :[ combine le matériel, les données et la redondance réseau pour couvrir simultanément plusieurs scénarios de défaillance.
- Concevoir toutes les actions sans danger pour être -désenergisées pour le trip- de sorte que la perte de puissance conduit le système à un état sûr plutôt que de le laisser dans un état indéterminé.
- Mise en œuvre d'une panne automatique seulement après des essais approfondis pour s'assurer que la sauvegarde peut assumer la charge sans introduire d'instabilité.
- Ne comptez jamais sur un seul chemin d'alarme – notifications sonores, visuelles et à distance de sauvegarde indépendamment.
- Équivalents composants redondants [ pour protéger contre les catastrophes environnementales.
- Conduire des exercices de décrochage réguliers et les inclure dans la formation des opérateurs.
- Surveiller la santé des sous-systèmes redondants (p. ex. tension d'alimentation, charge de la batterie, données SMART sur disque) et remplacer proactivement les pièces vieillissantes.
- Documenter toutes les redondances et la logique de sécurité en cas d'échec dans un manuel de conception du système pour aider au dépannage et aux mises à jour futures.
En suivant ces pratiques, les ingénieurs peuvent construire des systèmes d'acquisition de données qui non seulement recueillent des données de façon fiable, mais résistent aussi aux inévitables défaillances qui se produisent dans les milieux industriels et scientifiques réels.