La tolleranza di guasto nei microprocessori è essenziale per garantire un funzionamento affidabile nei sistemi critici, che comporta tecniche per rilevare, correggere o prevenire errori che possono verificarsi durante l'elaborazione.

Metodi di tolleranza di guasto

Sono state impiegate diverse tecniche per migliorare la tolleranza dei guasti nei microprocessori, tra cui ridondanza hardware, codici di errore e correzione, e approcci basati sul software. La ridondanza hardware comporta componenti duplicanti in modo che se uno non riesce, l'altro può assumere il controllo.

Codici di correzione di errore, come i codici Hamming, non solo rilevano ma correggono anche automaticamente alcuni tipi di errori. I metodi software comportano timer di watchdog e le routine di gestione delle eccezioni che monitorano la salute del sistema e rispondono rapidamente ai guasti.

Calcoli per la tolleranza di guasto

La tolleranza di errore di valutazione comporta spesso il calcolo del tempo medio del sistema tra guasti (MTBF) e tassi di errore. I modelli di affidabilità, come l'analisi dell'albero di guasto (FTA), aiutano a identificare i potenziali punti di guasto e stimare la robustezza del sistema. Ad esempio, se la probabilità di un guasto del componente è p, e viene utilizzata la ridondanza, l'affidabilità del sistema generale può essere calcolata in base al numero di unità ridondanti.

Nei sistemi con n componenti ridondanti, la probabilità che il sistema non riesca a essere spesso modellato come:

P(errore di sistema) = p]n]]

Approcci pratici

L'implementazione della tolleranza dei guasti nei microprocessori comporta la selezione di tecniche appropriate in base ai requisiti del sistema. La ridondanza hardware è comune nei dispositivi aerospaziali e medici in cui l'affidabilità è critica.

I progettisti incorporano anche architetture tolleranti ai guasti, come la Triple Modular Redundancy (TMR), dove tre moduli identici operano in parallelo, e un voto a maggioranza determina l'output corretto.