Introduzione

I dispositivi elettronici di memorizzazione dei dati sono la base silenziosa di moderne infrastrutture critiche. Dai sistemi di controllo e acquisizione dati (SCADA) che gestiscono le griglie elettriche alle piattaforme di dati elettronici (EHR), l'archiviazione dati affidabile è essenziale per la continuità operativa, la sicurezza e la sicurezza. Questi dispositivi, compresi i dischi rigidi (HDD), i dischi solidi-stato (SSD), e gli array di memoria flash, possono funzionare in condizioni difficili e sono soggetti a diversi

Modalità di fallimento comune

I guasti dei dispositivi di memorizzazione dei dati derivano da un complesso gioco di stress fisici, logici e ambientali, mentre i modi specifici di guasto variano per tecnologia, possono essere ampiamente classificati in degradazione dell'hardware, corruzione del software, fattori ambientali e errori umani.

Degradazione hardware

I componenti hardware dei dispositivi di memorizzazione sono soggetti a usura nel tempo. In HDD, i meccanismi di guasto principali includono l'usura dei cuscinetti, la stimolazione (frizione tra le teste di lettura/scrittura e i vagliatori), e l'insufficienza del motore del mandrino.

Corruzione del software

I bug del firmware possono causare un attacco di integrità del sistema di autenticazione o di corruzione dei dati in transito. L'infame attacco di "Stuxnet" ha dimostrato come il malware può colpire i controller di logica programmabili (PLC) e la loro memorizzazione associata, ma gli attacchi simili possono danneggiare il firmware di SSD o i metadati del sistema di file su HDD.

Fattori ambientali

L'infrastruttura critica spesso opera in ambienti difficili dove la temperatura, l'umidità, le vibrazioni e le interferenze elettromagnetiche (EMI) sono scarsamente controllate. Il runaway termico[] è un rischio particolare in array SSD: come le cellule riscaldano, le correnti di dispersione aumentano, generando più calore e accelerando il fallimento.

Errori umani

Nonostante l'automazione, l'errore umano rimane una causa principale di guasto di archiviazione dei dati in infrastrutture critiche. La configurazione di array RAID, come l'utilizzo di tipi di unità errati o l'impostazione di priorità di ricostruzione errata, può portare alla perdita di dati durante una ricostruzione.

Impatto sull'infrastruttura critica

Il fallimento di un singolo dispositivo di archiviazione può avere conseguenze di vasta portata a seconda del settore.

Griglie di potenza

I sistemi di gestione dell'energia sono stati utilizzati per il controllo di un sistema di gestione dell'energia (EMS).

Reti di trasporto

In reti ferroviarie, controllo del traffico aereo e sistemi di navigazione marittima tutti dipendono da un'archiviazione non volatile per dati critici per la sicurezza. In reti ferroviarie, controllori di circuito di traccia e sistemi di interlocking memorizzano modelli di segnale e configurazioni di rotta su supporti a stato solido. Un guasto può causare stati di segnale errati o operazioni di modalità degradate. Nel 2020, un operatore ferroviario importante nel Regno Unito ha sperimentato un ritardo molto diffuso dopo un evento di corruzione del firmware nei moduli di archiviazione di archiviazione dei suoi sistemi di interlocking.

Servizi sanitari

Gli ospedali e le cliniche si affidano allo storage per i record dei pazienti, l'imaging medico (PACS), i risultati del laboratorio e i dati di monitoraggio in tempo reale. Un guasto di archiviazione in un sistema elettronico di record di salute (EHR) può interrompere i flussi di lavoro clinici, ritardare i trattamenti critici e compromettere la sicurezza dei pazienti.

Strategie di mitigazione

Data l'elevata quota, le organizzazioni che gestiscono infrastrutture critiche devono adottare un approccio stratificato all'affidabilità dello storage.

Redunda dell'hardware

La ridondanza a più livelli, dispositivo, array e sito, è la prima linea di difesa. Le configurazioni RAID (soprattutto RAID 6 o RAID 10) proteggono dai guasti a singolo o a doppio motore. Tuttavia, RAID non è un backup; fornisce solo disponibilità durante una ricostruzione.

Manutenzione e monitoraggio regolari

Il monitoraggio attivo dei parametri di storage health, come SMART (Self-Monitoring, Analysis e Reporting Technology) attributi, fattore di amplificazione di scrittura e temperatura, può prevedere i guasti settimane in anticipo. Sostituzione di anomalie di pre-fallimento] è conveniente quando gli avvisi sono rilevati.

Controlli ambientali

Per il trasporto di applicazioni, ]) di livello industriale a stato solido unità (iSSD)] con più ampie frequenze di temperatura di esercizio (-40°C a +85°C) e il rivestimento conformale è consigliato fortemente schermatura elettromagnetica.

Backup e ripristino dei disastri

La strategia di backup segue la regola 3-2-1: tre copie di dati, su due tipi diversi di media, con una copia offsite. Per infrastrutture critiche, consideri i backup immutabili che non possono essere modificati o cancellati dal ransomware. ]I backup a bordo dell'aria] forniscono la massima protezione, ma devono essere testati regolarmente per la responsabilità.

Misure di sicurezza

I dispositivi di memorizzazione sono un vettore per attacchi informatici. Crittografare i dati a riposo utilizzando la crittografia a livello hardware (ad esempio, AES-256 con gli standard TCG Opal o IEEE 1667). Attuazione del controllo di accesso rigoroso per prevenire gli aggiornamenti del firmware non autorizzati.

Modalità di guasto emergenti

Con l'evoluzione della tecnologia di storage, emergeranno nuove modalità di guasto, comprendendo queste infrastrutture critiche a prova di futuro.

SSD per la discarica delle armi

Tuttavia, sotto carichi di lavoro estremamente pesanti – comuni nel logging e gli storici SCADA – la piscina di blocchi di ricambio può essere esaurita, portando a guasto prematuro. Over-provisioning] (allocando capacità extra non utilizzata dall'host) può mitigare questo, ma molti sistemi Newspace non lo configurano correttamente.

Attacchi crittografici e ransomware

Nel 2023, una grande azienda europea di energia ha subito un attacco ransomware che ha crittografato il firmware di più array di storage, che richiedono la sostituzione completa dei controller. I sistemi di backup-disk possono identificare le funzioni di blocco che sono sempre online particolarmente vulnerabili.

Corruzione di dati a bit Rot e Silent

Uno studio di Google 2018 sugli errori DRAM ha scoperto che circa l'8% dei DIMMs sperimenta almeno un errore correttibile all'anno, mentre errori non corretti si verificano ad un tasso inferiore ma non negativo. Per NAND flash, aumentando i tassi di errore bit (BER) come l'età delle celle può portare a pagine non leggibili se i codici di errore impiegano il sistema di archiviazione (ECC) sono insufficienti.

Migliori Pratiche per la Resilienza

Le organizzazioni dovrebbero incorporare l'affidabilità dello storage nei loro quadri di resilienza generali.

  • Condurre la modalità di guasto regolare e l'analisi degli effetti (FMEA)[ sui sottosistemi di memorizzazione, aggiornando i registri di rischio per ogni tipo di dispositivo e configurazione.
  • Implementare analisi predittive[[]] utilizzando l'apprendimento automatico sui dati sanitari per prevedere guasti con maggiore precisione rispetto agli avvisi basati sulla soglia.
  • Performi trapani di restauro trimestrale[] dai backup per garantire che sia hardware che software possano soddisfare RTO.
  • Personale del treno[] sulla corretta gestione del dispositivo, procedure di arresto e risposta degli incidenti specifici per i guasti di archiviazione.
  • Adopt vendor-agnostic monitoring tools[[]] che possono correlare la salute di archiviazione con altre metriche OT (ad esempio, la qualità di potenza, il traffico di rete).
  • Review e aggiornare le specifiche di approvvigionamento[[]] per richiedere funzionalità come protezione contro la perdita di potenza, ampia gamma di temperature e valutazioni di resistenza elevate per i dispositivi utilizzati in ruoli critici.
  • Ingage with industry groups[[]] come l'Associazione di Industria di Networking di Storage (SNIA) e l'Istituto di ingegneri elettrici ed elettronici (IEEE) per le linee guida aggiornate sull'affidabilità di storage nell'infrastruttura critica.

Conclusioni

Le modalità di guasto dei dispositivi elettronici di memorizzazione dei dati in infrastrutture critiche sono diverse e in evoluzione. Il degrado dell'hardware da stress normale e ambientale, la corruzione del software da bug o codice dannoso, e gli errori umani tutti rappresentano rischi significativi. Le conseguenze di un fallimento si estendono oltre la semplice perdita di dati a outage operativi, rischi di sicurezza e violazioni della sicurezza.