Il ruolo dei sistemi autonomi e dei server di routine nel migliorare la resilienza delle reti di infrastruttura critica

Le reti di infrastrutture critiche, come le reti di alimentazione, i sistemi di trasporto, le reti di approvvigionamento idrico e le reti di comunicazione, costituiscono la base operativa delle società moderne. Il loro funzionamento ininterrotto è essenziale per la sicurezza nazionale, la stabilità economica e la sicurezza pubblica. Negli ultimi anni, la frequenza e la raffinatezza dei cyberattacchi, i disastri naturali e i guasti tecnici hanno sottolineato l'urgenza di rendere queste reti resilienti.

Quali sono i sistemi autonomi e i server di routing?

Un sistema autonomo è una raccolta di reti IP e router sotto il controllo di un'unica entità amministrativa che presenta una politica comune di routing a Internet. Ogni AS è assegnato un unico numero di sistema autonomo (ASN), che agisce come suo identificatore nel protocollo Border Gateway (BGP) routing. Esempi comuni includono la rete di un fornitore di servizi Internet (ISP), un grande campus universitario, o un'agenzia governativa di routing una chiave.

A differenza dei tradizionali router che eseguono BGP individualmente, un RS raccoglie informazioni di routing da più pari, applica una politica unificata e distribuisce le decisioni di percorso migliore per i router collegati. Questo riduce la sovraccarico amministrativo, migliora la velocità di convergenza e consente un controllo più granulare sui flussi di traffico.

La sinergia tra AS e RS è fondamentale: l'AS fornisce il quadro amministrativo e politico, mentre il RS gestisce l'ottimizzazione dinamica e in tempo reale dei percorsi dati.

Perché Resilience Matters per le infrastrutture critiche

La resilienza è la capacità di un sistema di anticipare, resistere, adattarsi e recuperare rapidamente dalle interruzioni. Per l'infrastruttura critica, questo va oltre la semplice disponibilità.

  • Redundant[] – avendo percorsi multipli e diversi per i dati in modo che nessun singolo punto di guasto possa abbattere l'intero sistema.
  • Secure[] – in grado di rilevare e mitigare eventi di routing maligni come dirottamenti BGP, perdite di rotta, o attacchi di negazione-di-servizio (DoS).
  • Adaptable[] – in grado di reindirizzare dinamicamente il traffico in risposta alle condizioni di cambiamento, sia da incidenti informatici, danni fisici, o punte di carico.
  • Manageable[]] – permettendo agli amministratori di far rispettare politiche coerenti in una rete di grandi dimensioni e distribuita senza interventi manuali.

Dividendo la rete in domini AS coerenti e dotandole di RS intelligente, gli operatori possono costruire una difesa multistrato che mantiene i servizi essenziali online anche quando parti dell'infrastruttura sono compromesse.

Ad esempio, durante un'interruzione di corrente maggiore che disconnette un data center chiave, un AS con più peer upstream e un RS configurato correttamente può spostare istantaneamente il traffico verso percorsi attivi rimanenti, spesso senza alcuna interruzione percettibile agli utenti finali. Questa capacità è molto più efficace che affidarsi a tabelle di routing statiche o procedure di failover manuale, che possono richiedere minuti o anche ore di esecuzione.

Come AS e RS Migliorare la ridondanza e la tolleranza di default

Diversità multi-path attraverso il peering

Una delle principali tecniche di resilienza abilitate da AS è multi-homing] – collegando una rete critica a due o più fornitori a monte. Ogni connessione a monte appartiene ad un altro AS, creando la diversità del percorso a livello di Internet. Se un ISP soffre di un guasto BGP o di un taglio di fibra, la politica di routing dell'AS (applicatativatativa) può contare immediatamente sul percorso moderno

Inoltre, molti operatori di infrastrutture critiche partecipano a Internet Exchange Points (IXPs) dove si confrontano con più ASes direttamente. L'RS a un IXP semplifica questo agendo come server di route che raccoglie tavoli BGP da tutti i partecipanti e distribuisce una visione coerente, eliminando la necessità di ogni membro di configurare sessioni di peering con ogni altro membro.

Convergenza veloce con BGP e RS

La convergenza BGP – il tempo necessario per i router per concordare su nuove rotte dopo un fallimento – è stata storicamente lenta, spesso prendendo decine di secondi o più. In infrastrutture critiche, tali ritardi possono essere inaccettabili.

Inoltre, l'implementazione del RS come cervello centrale all'interno di un AS consente di definire sofisticate politiche di failover, ad esempio un RS può essere configurato per preferire percorsi che evitano regioni geografiche note per essere inclini a disastri naturali o per passare automaticamente a percorsi tunnel crittografati se un attacco DDoS viene rilevato sul percorso primario.

Miglioramenti di sicurezza tramite AS e RS

Difendere contro BGP Hijacks

Un attaccante annuncia un prefisso che appartiene ad un altro AS, deviando il traffico alle infrastrutture dannose. Le reti infrastrutturali critiche sono obiettivi principali perché trasportano dati sensibili o traffico di controllo. Un dirottamento potrebbe consentire un avversario di intercettare le comunicazioni, lanciare attacchi uomo-in-the-middle, o semplicemente interrompere il servizio.

I sistemi autonomi possono difendere contro i dirottamenti utilizzando RPKI (Resource Public Key Infrastructure), che convalidano crittograficamente che un AS è autorizzato ad annunciare un prefisso. Quando combinato con un Routing Server che applica la validazione di origine RPKI, qualsiasi annuncio di percorso illegittimo viene automaticamente rifiutato prima che possa influenzare la rete. Inoltre, RS può essere programmato per implementare il filtraggio BGP Flowspec, permettendo loro di spingere i filtri di eseguire l'intervento reale.

Attacco DDoS Mitigante con Blackholing RS-Driven

Una tecnica di mitigazione comune è il blackholing DDoS (RTBH), dove il traffico destinato ad un indirizzo IP della vittima è caduto al bordo della rete. Un Routing Server accelera questo processo permettendo agli operatori di iniettare un singolo percorso con uno speciale “buco” di secondi successivi, che il RS poi propaga a tutti gli attacchi di frontiera.

Molte implementazioni RS supportano anche controlli più granulari, come il blackholing selettivo basato sulla sorgente AS o la geolocalizzazione, consentendo la difesa mirata senza danni collaterali.

Strategie per l'implementazione di AS e RS in infrastrutture critiche

La distribuzione di AS e RS richiede un approccio sistematico che va oltre l'acquisto di hardware. Le organizzazioni responsabili dell'infrastruttura critica devono sviluppare un piano di resilienza di routing completo.

1. Progettazione di un'architettura gerarchica AS

Le grandi reti di infrastrutture critiche dovrebbero essere divise in più AS basate sulla funzione, sulla geografia o sulla classificazione della sicurezza. Ad esempio, una società di utilità potrebbe avere un AS per la sua rete di controllo della tecnologia operativa (OT), un altro per l'IT aziendale, e un altro per i servizi di customer-facing. Questa separazione limita il raggio di esplosione: una rottura in un AS (ad esempio, un attacco ransomware) non si propaga automaticamente agli altri.

2. Distribuisci server di routing ridondanti in posizioni diverse

Un unico RS è un unico punto di guasto. Le implementazioni critiche dovrebbero utilizzare almeno due istanze RS funzionali, idealmente in data center geograficamente separati con un uplink di potenza e rete indipendente. Queste RS possono operare in modalità attiva-standby o attiva-attiva, e devono sincronizzare il loro stato tramite un protocollo come la replica di stato di sessione del BGP o un meccanismo di cluster proprietario.

3. Implementare il monitoraggio in tempo reale e il ripristino automatico

Gli operatori di rete dovrebbero implementare strumenti che monitorano le dimensioni della tabella BGP, routing stabilità, visibilità prefissata e utilizzo dei link. Quando viene rilevata un'anomalia, come una improvvisa scomparsa di un prefisso critico o di un picco di latenza, il RS dovrebbe attivare automaticamente un reindirizzamento a un percorso di backup predeterminato, che richiede un'attenta configurazione delle comunità BGP e dei valori locali di preferenza in modo che le decisioni di intervento umano possano essere intelligenti.

4. Stabilire la collaborazione tra gli amministratori AS

Molte reti di infrastrutture critiche si affidano a ASes esterni (ad esempio, ISP, provider cloud) per la connettività. La resilienza viene migliorata quando gli amministratori di diverse organizzazioni si coordinano sulle politiche di routing, condividono l'intelligenza delle minacce e concordano sulle procedure di failover.

5. Condurre controlli regolari ed esercizi

La complessità della configurazione è il nemico della resilienza. Il team che gestisce AS e RS dovrebbe condurre audit trimestrali delle configurazioni BGP, della validità RPKI e delle politiche RS.

Caso di studio: Applicare AS e RS Resilience a una griglia intelligente

Considerate un'utilità elettrica regionale che gestisce una rete intelligente che collega migliaia di sensori, unità terminali remoti (RTUs), e controller di sottostazione. La rete di comunicazione della rete deve rimanere operativa anche se parti del sistema di alimentazione sono danneggiate da una tempesta o da un attacco informatico. L'utilità distribuisce il proprio AS (AS65001) con due sessioni BGP a due ISP diversi.

Durante un incidente informatico simulato, un aggressore tenta di annunciare un prefisso BGP più specifico (un dirottatore) per la rete di controllo dell'utilità. Il RS è configurato con la convalida RPKI; respinge immediatamente il prefisso dirottato perché il numero di origine AS non corrisponde all'autorizzazione crittografica.

Questo scenario illustra come AS e RS, quando correttamente implementato, forniscono una fondazione di routing resiliente che assorbe più tipi di interruzioni contemporaneamente. Gli stessi principi si applicano agli impianti di trattamento delle acque, alle reti di segnalazione ferroviaria e ai sistemi sanitari in cui l'integrità e la disponibilità dei dati non sono negoziabili.

Conclusioni

I sistemi autonomi e i server di routing non sono solo componenti dell'infrastruttura internet; sono strumenti essenziali per costruire resilienza nelle reti critiche che sostengono la vita moderna.

Per ulteriori informazioni sulle migliori pratiche di sicurezza, consultare l’iniziativa MANRS e la Guida di distribuzione di RKI da NIST[].