Table of Contents
Datenerfassungssysteme (DAS) sind das Rückgrat der industriellen Überwachung, wissenschaftlichen Forschung und automatisierten Prozesssteuerung. Sie wandeln physikalische Phänomene wie Temperatur, Druck, Vibration und Spannung in digitale Daten für die Analyse und Entscheidungsfindung um. In unternehmenskritischen Umgebungen – von Kernkraftwerken und pharmazeutischer Fertigung bis hin zu Luft- und Raumfahrtprüfungen und Ölraffinerien – kann ein einzelner Fehlerpunkt katastrophalen Datenverlust, unsichere Betriebsbedingungen oder verlängerte Ausfallzeiten verursachen. Der Aufbau von Widerstandsfähigkeit in ein DAS durch absichtliche Redundanz und ausfallsichere Funktionen ist daher nicht optional; es ist eine grundlegende Designanforderung. Dieser Artikel untersucht die architektonischen Strategien, Implementierungsmethoden und Best Practices für die Schaffung eines Datenerfassungssystems, das auch bei Ausfall von Komponenten betriebsfähig und sicher bleibt.
Redundanz in Datenerfassungssystemen verstehen
Redundanz bedeutet im Zusammenhang mit einer DAS die Duplizierung kritischer Komponenten oder Funktionen, damit das System bei einem Ausfall einer Komponente weiterarbeiten kann – oder zumindest anmutig ausfallen kann. Ziel ist es, einzelne Fehlerpunkte zu beseitigen und die Integrität, Kontinuität und Verfügbarkeit der Daten zu gewährleisten. Redundanz kann auf mehreren Ebenen angewendet werden: Hardware, Daten, Netzwerk und sogar Software.
Hardwareredundanz
Hardwareredundanz umfasst die Duplizierung von physikalischen Komponenten wie Sensoren, Signalkonditionierern, Analog-Digital-Wandlern (ADC), Steuerungen, Stromversorgungen und Speichergeräten.
- N+1 Redundanz: Eine zusätzliche Komponente wird der minimal erforderlichen Anzahl hinzugefügt (z. B. drei Stromversorgungen für ein System, das nur zwei benötigt).
- Hot Standby: Eine Sekundäreinheit läuft parallel zur Primäreinheit. Die Standby überwacht kontinuierlich die Ausgabe der Primäreinheit und übernimmt bei Ausfall mit null oder minimaler Unterbrechung. Dies ist bei Steuerungen und Hochgeschwindigkeits-Datenloggern üblich.
- Kaltes Standby: Eine Ersatzkomponente wird offline gehalten und nur aktiviert, wenn ein Fehler erkannt wird. Dieser Ansatz ist kostengünstiger, führt jedoch zu einer kurzen Verzögerung beim Failover.
- Sensor Voting (Triple Modular Redundancy): Drei identische Sensoren messen den gleichen Parameter; das System vergleicht Outputs und verwirft alle abweichenden Werte. Der Median oder Mehrheitswert wird verwendet. Diese Technik wird in der Luftfahrt und in der nuklearen Instrumentierung weit verbreitet eingesetzt (siehe Triple Modular Redundancy).
Die Wahl des richtigen Grades an Hardwareredundanz hängt von der Kritikalität der Messung, der mittleren Zeit zwischen den Fehlern (MTBF) der Komponenten und den Budgetbeschränkungen ab: Beispielsweise kann ein Temperaturüberwachungssystem in einem chemischen Reaktor eine dreifache Redundanz für den primären Sicherheitssensor rechtfertigen, während ein nichtkritischer Durchflussmesser nur ein Ersatzgerät im Regal benötigt.
Datenredundanz und Speicherzuverlässigkeit
Datenredundanz stellt sicher, dass die von einer DAS erfassten wertvollen Messungen nicht verloren gehen, wenn ein Speichergerät ausfällt.
- RAID 1 (Spiegelung) schreibt identische Daten auf zwei oder mehr Festplatten gleichzeitig. Wenn eine Festplatte ausfällt, arbeitet das System weiterhin vom Spiegel aus. RAID 5 oder 6 bieten ein Gleichgewicht zwischen Leistung und Fehlertoleranz durch Paritätsstreifen.
- Lokale und Remote-Daten-Duplizierung: Kritische Datenströme werden auf ein sekundäres lokales Laufwerk (z. B. eine SSD) kopiert und gleichzeitig an einen Remote-Server oder ein Cloud-Backup übertragen, um vor physischen Schäden, Diebstahl oder standortweitem Stromverlust zu schützen.
- Industrielle DAS schreiben häufig Daten an zwei unabhängige Logger. Wenn ein Logger ausfällt, geht der zweite ununterbrochen weiter. Dies ist bei Flugdatenschreibern und kontinuierlichen Emissionsüberwachungssystemen (CEMS) üblich.
Die Datenredundanz muss auch die Datenintegrität berücksichtigen. Techniken wie Prüfsummen und zyklische Redundanzprüfungen (CRC) stellen sicher, dass gespeicherte Daten nicht beschädigt wurden. Weitere Informationen zu bewährten Verfahren zur Datenspeicherung finden Sie im Leitfaden für nationale Instrumente zur Datenerfassung.
Netzwerkredundanz
Bei verteilten Datenerfassungssystemen kommunizieren mehrere Sensoren und Steuerungen über ein Netzwerk. Ein einzelner Kabelbruch oder ein Fehlerschalter kann eine ganze Zone isolieren. Netzwerkredundanz mindert dieses Risiko durch:
- Mehrere physikalische Pfade: Verwenden von zwei oder mehr unabhängigen Kabelrouten (z. B. drahtgebundenes Ethernet und Glasfaser), um die gleichen Endpunkte zu verbinden.
- Redundante Switches und Router: Bereitstellung von Dual-Netzwerk-Switches, die in einer Ringtopologie konfiguriert sind, unter Verwendung von Protokollen wie Rapid Spanning Tree Protocol (RSTP) oder Media Redundancy Protocol (MRP).
- Wireless Backup Links: In Remote- oder Mobil-DAS kann eine Mobilfunk- oder Satellitenverbindung als Backup dienen, wenn die primäre kabelgebundene Verbindung ausfällt.
- Protokoll-Redundanz: Mit industriellen Ethernet-Protokollen wie EtherNet/IP mit Device Level Ring (DLR) oder PROFINET mit Media Redundancy für nahtloses Failover.
Netzwerkredundanz ist besonders kritisch in SCADA-Systemen (Supervisory Control and Data Acquisition), bei denen Echtzeitdaten von Hunderten von Remote-Terminal-Einheiten (RTUs) ohne Unterbrechung in den zentralen Kontrollraum gelangen müssen.
Fail-Safe Features in Datenerfassungssystemen
Ein ausfallsicheres System ist so konzipiert, dass ein Ausfall nicht zu unsicheren Folgen führt, sondern dass es in einen vordefinierten sicheren Zustand übergeht, anstatt in unvorhersehbarer Weise weiterzuarbeiten.
Automatisches Herunterfahren und Notstopp
Wenn ein kritischer Fehler erkannt wird, wie z. B. ein Sensor, der außerhalb sicherer Parameter liest, ein Timeout des Controllers oder ein Kommunikationsverlust, sollte das System automatisch eine sichere Abschaltsequenz einleiten. Dies kann Motorentstromung, Schließventile oder Stromquellen umfassen. Die Abschaltlogik sollte wann immer möglich fest verdrahtet sein (relaisbasiert), um zu vermeiden, dass sie sich auf Software verlassen, die selbst ausgefallen sein könnte.
Alarmmeldung und -verkündigung
Fehlersichere Systeme müssen die Bediener unverzüglich alarmieren, Alarme sollten geschichtet werden:
- Visual Alarms: Blinklichter, HMI-Pop-ups und Statusanzeigen.
- Audible Alarms: Sirenen, Hörner oder Sprachankündigungen.
- Remote-Benachrichtigungen: E-Mails, SMS oder automatisierte Telefonanrufe an externes Personal.
- Logging: Alle Alarme sollten zeitgestempelt und in einem nichtflüchtigen Protokoll für die Analyse nach dem Ereignis gespeichert werden.
Alarmmanagementstandards wie ISA-18.2 oder EEMUA-191 bieten Frameworks, um Alarmmüdigkeit zu vermeiden, indem sie Störalarme priorisieren und unterdrücken.
Anmutige Degradation
Nicht jeder Fehler rechtfertigt eine vollständige Systemabschaltung. Anmutige Degradation ermöglicht es dem DAS, unter Beibehaltung der Sicherheit weiterhin mit einer eingeschränkten Leistungsfähigkeit zu arbeiten.
- Wenn einer von drei redundanten Temperatursensoren ausfällt, verwendet das System den Durchschnitt der verbleibenden zwei und protokolliert den abgebauten Zustand.
- Wenn eine Datenverbindung mit hoher Bandbreite ausfällt, puffert der lokale Logger Daten lokal, bis die Verbindung wiederhergestellt ist.
- Bei Ausfall eines Stromversorgungsmoduls können die verbleibenden Module möglicherweise nicht alle Sensoren unterstützen, so dass das System wesentliche Messungen priorisiert und unkritische Kanäle deaktiviert.
Die Implementierung von anmutiger Degradation erfordert eine sorgfältige Risikoanalyse und klare Priorisierungsregeln, die während des Systemdesigns definiert werden.
Watchdog Timer und Heartbeat Monitoring
Ein Watchdog-Timer (WDT) ist ein Hardware- oder Softwarezähler, der die korrekte Ausführung des Hauptregelkreises überwacht. Die Anwendung setzt den Timer periodisch zurück. Wenn die Anwendung einfriert oder abstürzt, läuft der Timer ab und löst eine System-Reset- oder Fail-Safe-Aktion aus. Viele Mikrocontroller und SPS haben eingebaute WDTs. In verteilten Systemen wird eine Herzschlagmeldung zwischen dem primären und dem Failover-Controller gesendet. Wenn der Failover-Controller mehrere Herzschläge verpasst, übernimmt er die Kontrolle. Dies ist die Grundlage vieler Hot-Standby-Architekturen.
Datenvalidierung und Fehlerkorrektur
Fail-safe-Funktionen sind nicht auf Hardware beschränkt – sie umfassen auch Software-Prüfungen, die eingehende Daten validieren, bevor sie für die Steuerung oder Protokollierung verwendet werden.
- Range Checks: Lehnen Sie Messwerte ab, die außerhalb der physikalisch plausiblen Grenzen liegen (z. B. eine Temperatur von -300°C).
- Rate-of-Change Checks: Flag-Messwerte, die sich schneller als physisch möglich ändern, was auf einen Sensorfehler oder ein Verdrahtungsproblem hinweisen kann.
- Cross-Channel Validation: Vergleichen Sie redundante Messungen miteinander.
- Fehlerkorrekturcodes (ECC): Wird in Speicher- und Kommunikationsprotokollen verwendet, um Einzelbitfehler zu erkennen und zu korrigieren.
Weitere Informationen zur Datenvalidierung in industriellen Instrumenten finden Sie im Omega Engineering Guide to Data Acquisition System Design.
Design-Überlegungen für Redundante und Fail-Safe DAS
Der Aufbau eines robusten DAS beginnt lange vor dem Ziehen des Kabels. Es erfordert einen systematischen Ansatz, der die Fehlermodus- und Effektanalyse (FMEA), die Architekturauswahl und die Lebenszyklusplanung umfasst.
Fehlermodus- und Effektanalyse (FMEA)
FMEA ist eine strukturierte Methode, mit der alle möglichen Fehlermöglichkeiten einer Komponente oder eines Teilsystems ermittelt und die Auswirkungen jedes Fehlers bewertet werden können. Für jeden Fehlermodus weisen die Ingenieure eine Schwere, ein Auftreten und eine Erkennungsbewertung zu. Der Ergebnisleitfaden zeigt, wo Redundanz und ausfallsichere Funktionen am dringendsten benötigt werden. Beispielsweise könnte eine FMEA aufzeigen, dass ein einzelnes Netzteil das höchste Risiko darstellt, was die Hinzufügung einer N+1-Konfiguration erforderlich macht.
Redundanz Architekturauswahl
Es gibt mehrere klassische Architekturen, jede mit Kompromissen:
- 1+1 (Duplex) Redundanz: Zwei identische Einheiten, eine aktiv, eine Bereitschaft. Einfach, aber verdoppelt die Hardwarekosten. Wird für kritische Controller und Datenlogger verwendet.
- 2-of-3 Voting (TMR): Drei Einheiten mit Mehrheitsabstimmung. Bietet hohe Fehlertoleranz, verdreifacht aber Kosten.
- M-of-N Redundanz: Allgemeiner: Das System funktioniert, solange mindestens M von N Einheiten funktionsfähig sind.
- Kalt vs. Heißer Standby: Heißer Standby erfordert kontinuierliche Strom- und Kommunikationsbandbreite, liefert jedoch nahezu sofortiges Failover. Kalter Standby ist billiger, führt jedoch zu einer Verzögerung und erfordert möglicherweise Eingriffe.
Die Wahl hängt von der erforderlichen Verfügbarkeit, dem Sicherheitsintegritätsniveau (SIL) und dem Budget ab.
Redundanz des Stromsystems
Strom ist der häufigste Single Point of Failure in DAS. Redundante Stromversorgungseinheiten (PSUs) mit Dioden-ODER-Injektion oder Load-Sharing-Schaltungen verhindern, dass ein einzelner PSU-Ausfall das System herunterfährt. Unterbrechungsfreie Stromversorgungsgeräte (UPS) bieten Batterie-Backup für kurze Ausfälle, während Generatoren längere Ausfallzeiten bewältigen. Für kritische Fernstationen können Solarmodule mit Batteriebänken oder Brennstoffzellen verwendet werden. Die Stromüberwachung sollte sowohl die Hauptversorgung als auch den Batteriezustand verfolgen, um eine frühzeitige Warnung vor einem Ausfall zu geben.
Umwelt- und physischer Schutz
Redundanz bedeutet nichts, wenn ein Hochwasser, ein Feuer oder ein seismisches Ereignis sowohl die primäre als auch die Backup-Funktion ausschaltet.
- Platzieren Sie kritische Datenlogger in separaten Gehäusen oder sogar separaten Räumen.
- Routen redundanter Netzwerkkabel über verschiedene physikalische Pfade (z. B. unterirdischer oder Overhead).
- Verwenden Sie korrosionsbeständige Steckverbinder und konforme Beschichtung auf Leiterplatten in rauen Umgebungen.
- Installieren Sie Überspannungsschutz und Isolationsbarrieren auf allen E / A-Leitungen, um zu verhindern, dass sich Blitz- oder Erdschleifenschäden ausbreiten.
Für raue industrielle Umgebungen siehe den Analog Devices Artikel über Datenerfassung in rauen Umgebungen.
Testen und Pflegen von Redundanz- und Fail-Safe-Features
Ein redundantes System, das noch nie getestet wurde, ist nicht redundant – es ist eine theoretische Absicherung. Regelmäßige Tests überprüfen, ob Failover funktioniert und dass Alarme korrekt ausgelöst werden.
Geplante Failover-Bohrungen
Planen Sie periodische Abschaltungen einzelner Komponenten (z. B. Ziehen des Steckers am Primärcontroller), um das Failover-Verhalten zu beobachten. Das System sollte nahtlos in den Bereitschaftszustand wechseln und das Ereignis sollte protokolliert werden. Nach dem Test sollte ein manuelles Failback durchgeführt werden, um wieder in den Normalbetrieb zurückzukehren. Die Ergebnisse dokumentieren und die Schwellenwerte oder Timer nach Bedarf anpassen.
Eingebauter Selbsttest (BIST)
Moderne DAS-Komponenten enthalten häufig BIST, das beim Start und periodisch während des Betriebs läuft. Beispielsweise kann ein redundantes Netzteil seine Ausgangsregelung testen und jede Drift melden. Ein intelligenter Sensor kann einen Diagnosezyklus durchführen, der seine interne Referenzspannung überprüft. BIST-Ergebnisse sollten zentralisiert und alarmiert werden.
Firmware und Software Updates
Redundanzlogik wird häufig in Firmware implementiert. Wenn Updates vom Hersteller veröffentlicht werden, sollten sie vor der Bereitstellung auf Produktionssystemen in einer Staging-Umgebung getestet werden. Durch das Rollen von Updates (Aktualisierung eines Knotens nach dem anderen) wird die Verfügbarkeit des Systems gewahrt.
Wartungsprotokolle und Lifecycle Management
Jede redundante Komponente hat eine endliche Lebensdauer. MTBF-Daten verfolgen und Komponenten proaktiv austauschen – insbesondere Elektrolytkondensatoren in Netzteilen und Batterien in USV-Geräten. Eine gut gepflegte DAS mit dokumentierten Redundanztests wird eine höhere Verfügbarkeit und weniger ungeplante Ausfälle haben.
Praktische Beispiele für Redundanz und Fail-Safe Umsetzung
Beispiel 1: Remote Umweltüberwachungsstation
Eine Wetterstation in einem abgelegenen Berggebiet protokolliert Temperatur, Feuchtigkeit, Windgeschwindigkeit und Sonneneinstrahlung mithilfe eines DAS. Die Station wird mit einem Solarpanel und einer Batterie betrieben. Die Redundanz wird wie folgt realisiert:
- Zwei unabhängige Temperatursensoren (PT100 RTDs) in unterschiedlichen Höhen.
- Ein Backup-Mobilfunkmodem, das aktiviert wird, wenn die primäre Satellitenverbindung ausfällt.
- Dual microSD-Karten im Datenlogger - wenn eine Karte ausfällt, werden die Daten zur zweiten fortgesetzt.
- Die Überwachung der Batteriespannung löst einen fehlersicheren Modus mit geringem Stromverbrauch aus, der nicht wesentliche Messungen (z. B. Sonneneinstrahlung) aussetzt, um die Lebensdauer der Batterie zu verlängern.
Beispiel 2: Kontinuierliches pharmazeutisches Mischverfahren
Eine pharmazeutische Anlage mischt Wirkstoffe nach einer geregelten DAS. Sicherheitsanforderungen erfordern die Einhaltung von SIL 2. Das System umfasst:
- Dreifache modulare Redundanz (2oo3) für kritische Druck- und Temperatursensoren im Reaktionsgefäß.
- Redundante SPS mit heißem Standby – das Backup übernimmt innerhalb von 50 ms, wenn die primäre ausfällt.
- Notabschaltung mit festverdrahteten Relais, die Ventile schließen und Entlüftungsöffnungen öffnen, wenn die Reaktortemperatur eine sichere Grenze überschreitet oder wenn die Kommunikation mit der DAS für mehr als 200 ms verloren geht.
- Alarm Eskalation: zuerst lokales Horn, dann Pager zum Schicht Supervisor, und wenn nicht innerhalb von 2 Minuten bestätigt, automatischer Aufruf an den Betriebsleiter.
Beispiel 3: Hochgeschwindigkeits-Vibrationsüberwachung für Turbinen
In einer Stromerzeugungsanlage überwacht ein Hochgeschwindigkeits-DAS (10 kHz pro Kanal) die Lagerschwingungen einer Gasturbine. Der Verlust der Überwachung kann zu einem katastrophalen Schaufelausfall führen.
- Zwei unabhängige Beschleunigungsmesser pro Lager (jeweils mit eigenem Signalkonditionierer und ADC).
- Dual redundante Datenkonzentratoren mit einem deterministischen Failover unter Verwendung eines Ringnetzwerks.
- RAID 1 SSD-Speicher in der Haupt-DAS-Einheit und ein paralleles Schreiben an einen Historikerserver über ein separates Netzwerk.
- Ein Watchdog-Timer, der einen Alarm auslöst, wenn das DAS für mehr als eine Sekunde keine Herzschlagimpulse mehr an das Turbinensteuerungssystem sendet.
Zusammenfassung der Best Practices
Abschließend finden Sie hier eine konsolidierte Reihe von Best Practices für die Integration von Redundanz- und Ausfallsicherheitsfunktionen in ein Datenerfassungssystem:
- Beginn mit einer gründlichen Fehlermodianalyse (FMEA), um die kritischsten Einzelfehlerpunkte zu identifizieren, bevor Sie ein Redundanzschema auswählen.
- Verwenden Sie einen mehrschichtigen Ansatz: kombinieren Sie Hardware, Daten und Netzwerkredundanz, um mehrere Fehlerszenarien gleichzeitig abzudecken.
- Entwerfen Sie alle ausfallsicheren Aktionen, um “entregt zu werden, um zu stolpern”], so dass der Verlust von Energie das System in einen sicheren Zustand treibt, anstatt es in einem unbestimmten Zustand zu lassen.
- Implementieren Sie das automatische Failover nur nach umfangreichen Tests, um sicherzustellen, dass das Backup die Last übernehmen kann, ohne Instabilität einzuführen.
- Verlasse dich niemals auf einen einzigen Alarmpfad – unabhängig von akustischen, visuellen und Fernbenachrichtigungen.
- Zum Schutz vor Umweltkatastrophen werden redundante Komponenten physisch getrennt.
- Führen Sie regelmäßige Failover-Übungen durch und nehmen Sie sie in die Bedienerschulung auf.
- Überwachen Sie den Zustand redundanter Subsysteme (z. B. Stromversorgungsspannung, Batterieladung, Festplatten-SMART-Daten) und ersetzen Sie proaktiv alternde Teile.
- Dokumentieren Sie alle Redundanzen und ausfallsichere Logik in einem Systemdesignhandbuch, um die Fehlersuche und zukünftige Upgrades zu unterstützen.
Durch die Befolgung dieser Praktiken können Ingenieure Datenerfassungssysteme bauen, die nicht nur Daten zuverlässig erfassen, sondern auch den unvermeidlichen Ausfällen widerstehen, die in realen industriellen und wissenschaftlichen Umgebungen auftreten. Die Investition in Redundanz und ausfallsicheres Design zahlt sich aus, indem sie Ausfallzeiten vermeidet, Sicherheitsrisiken reduziert und die Datenintegrität bewahrt - was das System wirklich widerstandsfähig macht.