Introduzione alle reti neurali nel controllo non lineare

I problemi di controllo non lineari pervadono l'ingegneria moderna attraverso la robotica, l'aerospaziale, l'industria automobilistica, i processi e i sistemi autonomi. A differenza dei sistemi lineari, l'uscita di un sistema non lineare è non proporzionale al suo input né regge la sovrapposizione. Questa complessità intrinseca rende tradizionali tecniche di controllo lineare come PID o controller di stato-feedback o anche quando applicati al di un indirizzo inadeguato rispetto a una regione operativa non corretta.

Le reti neurali sono particolarmente interessanti perché possono modellare mappature non lineari arbitrariamente complesse senza richiedere espliciti modelli matematici del sistema. Questo è fondamentale quando la fisica sottostante è scarsamente compresa, fortemente incerta o incerta. Imparando le dinamiche del sistema in linea o offline, i controller di rete neurali possono adattare, generalizzare e mantenere le prestazioni in caso di errori di metodi convenzionali.

Fondamenti di controllo non lineare e perché reti neurali?

La difficoltà dei sistemi non lineari

I sistemi non lineari presentano comportamenti come punti di equilibrio multipli, cicli di limite, biforcazioni e caos. Gli obiettivi di controllo come stabilizzazione, tracciamento e rifiuto di disturbo diventano molto più difficili perché la risposta del sistema cambia con le condizioni operative. Il controllo lineare classico si basa sulla linearizzazione intorno a un punto di funzionamento fisso, ma questa approssimazione locale si rompe quando il sistema si allontana da quel punto.

Anche quando esiste un modello di primo principio, le incertezze dei parametri, gli effetti non modellati e le perturbazioni ambientali richiedono un approccio adattativo o basato sull'apprendimento. Le reti neurali offrono un percorso guidato dai dati per approssimare queste dinamiche sconosciute e i controllori di sintesi che si adattano automaticamente.

Perché Neural Networks?

Le reti neurali possiedono diverse proprietà che le rendono eccezionalmente adatte al controllo non lineare:

  • Raccolta universale:[] Una rete neurale di feedforward con almeno uno strato nascosto e un numero sufficiente di neuroni può approssimare qualsiasi funzione continua su un dominio compatto a qualsiasi accuratezza desiderata, come stabilito dal teorema di approssimazione universale. Questa proprietà è la base del loro utilizzo nella modellazione di non linearità del sistema.
  • Adaptability and Learning:[ Attraverso l'apprendimento supervisionato, non supervisionato o di rinforzo, le reti neurali possono aggiornare i propri parametri interni (pesi e biasi) per riflettere i cambiamenti nella dinamica del sistema, consentendo l'adattamento online senza richiedere una ri-identificazione completa del sistema.
  • Parallel Processing:[] La natura distribuita del calcolo neurale permette valutazioni rapide di feed-forward, che è fondamentale per il controllo in tempo reale in cui gli intervalli di campionamento possono essere brevi come millisecondi.
  • Robustness to Noise:[ Con una corretta formazione, le reti neurali possono filtrare il rumore di misura e generalizzare da dati parziali o corrotti, una caratteristica vitale per i loop pratici del sensore-a-actuatore.

Questi attributi hanno motivato una vasta ricerca in il controllo della rete (NNC)[], formando un campo ricco all'incrocio della teoria dell'apprendimento e del controllo della macchina.

Architettura di rete neurale core per il controllo

Reti neurali (FNN)

L'architettura più semplice e più ampiamente utilizzata nel controllo è il percettro multistrato (MLP) con uno o due strati nascosti. Le FNN sono tipicamente impiegate per l'approssimazione delle funzioni statiche, come l'apprendimento delle dinamiche inverse di un manipolatore robot.

Reti neurali ricorrenti (RNN) e Memoria a breve termine (LSTM)

Per i sistemi con dinamiche, dove lo stato si evolve nel tempo e dipende da ingressi e stati precedenti, le reti ricorrenti sono una scelta naturale. Le RNN hanno connessioni di feedback interne che danno loro una memoria di segnali passati. Ciò li rende efficaci per l'identificazione del sistema (apprendimento della funzione di transizione di un impianto) e per il controllo predittivo del modello dove le uscite future devono essere prevedibili su un orizzonte.

Reti neurali convoluzionali (CNN) e modelli ibridi

Mentre le CNN sono utilizzate principalmente per l'elaborazione delle immagini, hanno trovato applicazioni in controllo quando è coinvolto il feedback visivo. Ad esempio, una CNN può elaborare immagini della fotocamera per stimare lo stato (ad esempio, la posizione end-effector di un manipolatore), e poi una seconda rete o un controller standard genera il segnale di controllo.

Reservoir Computing / Echo State Networks (ESNs)

Per un training estremamente veloce e un controllo in tempo reale, le reti eco-stati (un tipo di elaborazione del serbatoio) hanno ottenuto una trazione. L'idea è quella di utilizzare un serbatoio casuale fisso che mappa i segnali di ingresso in uno spazio ad alta dimensione, e solo formare un semplice strato di uscita lineare. La formazione è estremamente efficiente (risolvere una regressione lineare), rendendo ESN adatti al controllo adattativo online in applicazioni come la soppressione del tremore in robotica assistiva o il controllo delle vibrazioni in tempo reale.

Ogni architettura porta i trade-off tra potere rappresentativo, complessità di formazione e costo computazionale. La scelta dipende dal problema di controllo specifico e dalle risorse computazionali disponibili.

Strategie di controllo basate sulla rete neurale

I ricercatori di controllo hanno sviluppato diversi paradigmi che integrano reti neurali nel circuito di controllo. I tre più importanti sono ]controllo diretto[], controllo predittivo del modello neurologico (NMPC)[]], e controllo adattativo.

Controllo diretto neurale

La rete riceve gli stati del sistema corrente (o una serie di misure rilevanti) e emette direttamente il segnale di controllo. La formazione può essere eseguita offline utilizzando un set di dati delle mappe di stato-controllo desiderate (ad esempio, da un esperto umano o da un controller ottimale), o online utilizzando l'apprendimento di rinforzo (RL).

Un esempio classico è neuro-control[] per il monitoraggio della traiettoria del braccio robotico. Una rete di feedforward è addestrata per imparare le dinamiche inverse del braccio: data una accelerazione desiderata, la rete emette le coppie articolari. Una volta addestrata, la rete può calcolare i comandi di controllo in una frazione di un millisecondo, permettendo il controllo ad alta banda.

Nell'apprendimento del rinforzo, la rete neurale agisce come approssimatore della politica. L'agente interagisce con l'ambiente, raccoglie premi (o costi) e aggiorna i suoi pesi per massimizzare la ricompensa cumulativa. Il controllo diretto neurale basato su RL è stato dimostrato con successo nella stabilizzazione del quadrotore, nella manipolazione dei robot e nel gioco (ad esempio, AlphaGo).

Controllo predittivo del modello neurale (NMPC)

Il controllo predittivo del modello (MPC) risolve un problema di ottimizzazione online in ogni momento: dato un modello dell'impianto, calcola una sequenza di future azioni di controllo che minimizzano una funzione di costo su un orizzonte di previsione, soggetto a vincoli. La qualità del MPC dipende fortemente dall'accuratezza del modello. Le reti neurali sono utilizzate per imparare questo modello dai dati, sostituendo il modello fisico tradizionale basato.

I vantaggi sono significativi: il modello di rete neurale può catturare dinamiche complesse e non lineari difficili da ricavare analiticamente. Ad esempio, nel controllo del processo chimico, un modello di rete neurale di un reattore può prevedere concentrazioni e temperature future, consentendo al MPC di calcolare posizioni di valvola ottimali nel rispetto dei vincoli di sicurezza. Il basso è il costo computazionale, risolvendo l'ottimizzazione ad ogni campione può essere esigente, soprattutto con reti profonde.

Una variante popolare è la rete non lineare autoregressiva con ingressi esogeni (NARX)], che modella l'uscita del sistema come funzione di uscite passate e ingressi passati. Questo modello è poi incorporato nell'ottimizzazione MPC. Per garantire la fattibilità, i vincoli sono spesso ammorbiditi e la rete deve essere addestrata su dati che coprono la regione operativa prevista.

Controllo adattivo neurale

Il controllo adattivo ha una lunga tradizione nella teoria del controllo, dove i parametri del controller (gains) sono regolati online per far fronte alle variazioni dei parametri.

  • Controllo neurale adattivo diretto:[] Il controller è una rete neurale i cui pesi sono sintonizzati online per ridurre al minimo alcune misure di tracciamento o stabilità. Ad esempio, le leggi di adattamento basate su Lyapunov sono derivate per garantire che il sistema a cerchio chiuso rimanga stabile mentre la rete impara.
  • Controllo neurale adattivo indiretto: Sono utilizzate due reti: uno agisce come identificatore (modello dello stabilimento) e l'altro come controller. L'identificatore viene aggiornato online in base ai dati di input-output e il controller viene ricalcolato (o aggiornato) in base al modello identificato.

Il controllo neurale adattivo ha dimostrato efficacia per sistemi con parametri di tempo-varia, come il controllo del volo aereo, dove i coefficienti aerodinamici cambiano con altitudine e numero di Mach, o per il controllo del passo delle turbine eoliche sotto velocità del vento. La sfida principale consiste nel garantire che l'adattamento non porti a un'instabilità o ad un eccessivo sforzo di controllo, è necessaria un'analisi rigorosa della stabilità, spesso utilizzando argomenti di teoria di passività.

Formazione Neural Networks per il controllo

Formazione Offline con l'apprendimento automatico

Quando è disponibile un dataset sufficientemente rappresentativo, i modelli di rete neurale possono essere formati offline utilizzando l'apprendimento supervisionato standard.Per l'identificazione del sistema, i dati di input-output vengono raccolti dallo stabilimento e la rete è addestrata a prevedere le uscite future.

Allenamento online e adattamento in tempo reale

La formazione off-line è spesso insufficiente perché il sistema può operare in regioni non coperte durante la formazione, o i suoi parametri possono derivare. La formazione on-line permette alla rete di adattarsi continuamente. Ciò può essere fatto utilizzando metodi basati su gradiente (ad esempio, discesa gradiente stocastico con slancio) o meno quadrati ricorsivi, ma deve essere attentamente implementato per evitare la cateterizzazione della pianta.

Nell'apprendimento dei rinforzi, la formazione è intrinsecamente online (o in batch-online come in Deep Q‐Networks). L'agente esplora l'ambiente utilizzando una strategia di esplorazione (ad esempio, epsilon-greedy) durante l'aggiornamento della rete politica.

Applicazioni delle reti neurali nel controllo non lineare

Robotica

I controller di rete neurali sono utilizzati per il controllo della coppia di livello congiunto, la manipolazione del corpo intero e la locomozione. Ad esempio, Deep rinforzo learning[] è stato utilizzato per formare simulazioni quadrupede per camminare e correre su terreni complessi. La rete neurale prende letture dei sensori (angolari congiunti, dati di apprendimento).

Veicoli autonome

La guida end-to-end, dove una rete neurale mappa direttamente le immagini della fotocamera ai comandi sterzante e a farfalla, è un'applicazione di controllo neurale diretto. Pionierizzata dal sistema ALVINN alla fine degli anni '80, le versioni moderne utilizzano CNNs profondi (ad esempio, NVIDIA’s PilotNet) e sono state dimostrate nel traffico reale.

Controllo dei processi e ingegneria chimica

Le dinamiche non lineari sono inerenti ai reattori chimici, alle colonne di distillazione e agli scambiatori di calore. I modelli MPC neurali hanno dimostrato ottime prestazioni nel tracciare i setpoint e nel respingere i disturbi, spesso superando il MPC lineare tradizionale. Ad esempio, una rete neurale può modellare la complessa cinetica di un reattore a lotto, consentendo un controllo ottimale della temperatura per massimizzare il rendimento evitando condizioni non sicure.

Sistemi aerospaziale e marino

I controllori adattativi neurali sono stati testati per il controllo del mal tollerante, come compensare una superficie di controllo bloccata, relearning, l'efficacia del controllo rimanente. Nei veicoli marini, le reti neurali sono utilizzate per il posizionamento dinamico dei vasi in condizioni di mare variabili.

Sfide e problemi aperti

Nonostante i successi impressionanti, diversi ostacoli devono essere superati prima che i controller di rete neurali diventino standard nei sistemi critici della sicurezza.

  • Garantisce stabilità e robustezza:[] Provendo che un controller di rete neurale non guiderà il sistema instabile in tutte le condizioni possibili è estremamente difficile a causa della non linearità della rete stessa. Mentre gli approcci basati su Lyapunov esistono per alcune architetture, spesso impongono ipotesi restrittive. L'integrazione con la teoria del controllo robusto è un'area attiva.
  • Complessità computazionale:[ Le reti profonde richiedono una computa significativa per passi avanti e indietro. In tempo reale sono preferiti i controller incorporati con vincoli di latenza rigorosi, le reti più semplici (ad esempio, a due isolati) .
  • Requisiti dei dati:[ I modelli neurali ad alta fedeltà richiedono set di dati di grandi e diversi. Per sistemi che sono costosi da operare o impossibili da eccitare sulla gamma di funzionamento completa (ad esempio, reattori nucleari), la scarsità dei dati è una barriera importante.
  • Interpretabilità:[ Le reti neurali sono spesso considerate come scatole nere. Per l'approvazione e la diagnosi dei guasti, gli ingegneri devono capire perché un controller ha preso una determinata decisione.
  • Esplorazione sicura:[] Nell'apprendimento online (soprattutto RL), il controller può esplorare azioni che portano a stati pericolosi o dannosi.

Le direzioni future

Guardando avanti, diverse tendenze modellano la prossima generazione di controllo basato sulla rete neurale:

  • Physics‐Informed Neural Networks (PINNs):] Integrando equazioni differenziali parziali nella funzione di perdita, PINNs può modellare sistemi con dati radi rispetto alle leggi fisiche.
  • Meta‐Learning e l'adattamento di Few‐Shot:[] Le reti che possono adattarsi alle nuove dinamiche con solo una manciata di osservazioni ridurranno notevolmente la necessità di una formazione offline estesa.
  • Integrazione con metodi formali:[] Combinando i controller neurali con strumenti di verifica (ad esempio, analisi di raggiungibilità, certificati di barriera) può fornire garanzie peggiori, spostandosi verso la certificazione dei sistemi di controllo basati sull'apprendimento.
  • Acceleratori di Hardware:[[] I processori di rete neurali dedicati (NPU) e le implementazioni FPGA renderanno possibile l'inferenza in tempo reale delle reti profonde in sistemi incorporati a bassa potenza, espandendo applicazioni in micro-droni e robotica indossabile.

Poiché queste tecnologie maturano, le reti neurali diventeranno un componente sempre più standard nella cassetta degli strumenti dell’ingegnere di controllo, che completa i metodi classici piuttosto che sostituirli completamente. La sinergia tra teoria del controllo e apprendimento automatico continuerà a spingere i confini di ciò che i sistemi autonomi possono raggiungere.

Conclusioni

Le reti neurali hanno trasformato il paesaggio del controllo non lineare, consentendo soluzioni a problemi che in precedenza erano intrattabili con metodi lineari. La loro capacità di approssimare dinamiche complesse, adattarsi online, e imparare dai dati li rende indispensabili per la robotica moderna, veicoli autonomi e controllo avanzato del processo.

[FLT] ] [Narendra e Parthasarathy (1990)[FLT]], l'indagine completa sull'apprendimento profondo del rinforzo per il controllo Mnih et al. (2015), e la guida pratica al MPC neurale [FLT]