Introduzione

La decodifica dei segnali cerebrali da registrazioni non invasive o invasive è una delle più ambiziose frontiere della moderna neuroscienza computazionale. L'elettroencefalografia (EEG), la magnetoencefalografica (MEG), la risonanza magnetica funzionale (fMRI), e l'elettrocorticografia (ECoG) producono flussi di dati di diagnostica ad alta dimensione, rumorosi e non-stazione.

I segnali del cervello sono caratterizzati da bassi rapporti di segnale-to-noise, elevata variabilità inter-soggetto e complesse dinamiche spatio-temporali. Le tubazioni tradizionali di apprendimento automatico hanno richiesto un'estrazione di funzioni artigianali, come densità spettrali di potenza o schemi spaziali comuni.

Approcci della rete neurale tradizionale

I primi tentativi di applicare reti neurali ai segnali cerebrali si basano su multilayer perceptrons (MLPs). Queste reti di alimentazione completamente connesse prendono un vettore di caratteristiche – tipicamente ingegnerizzate dal segnale grezzo – e imparano una mappatura non lineare degli algoritmi a un'uscita desiderata.

In primo luogo, MLP tratta le caratteristiche di input come indipendenti, ignorando la topologia spaziale degli elettrodi e l'ordinazione temporale dei campioni. In secondo luogo, il numero di parametri cresce rapidamente con la dimensione dell'ingresso, portando ad un alto rischio di sovraccarico sui set di dati relativamente piccoli tipici degli esperimenti BCI (spesso meno di mille prove per soggetto).

Limitazioni di reti completamente collegate

Oltre ai problemi sopra menzionati, gli strati completamente collegati ignorano la località delle informazioni. In un montaggio EEG, gli elettrodi adiacenti spesso registrano attività correlate da fonti corticali vicine. Uno strato convoluzionale che rispetta questa connettività locale puÃ2 sfruttare tale struttura spaziale molto piÃ1 efficiente. Allo stesso modo, la successione temporale dei campioni contiene informazioni critiche sui potenziali legati agli eventi (ERP) e sulle dinamiche di fase oscillatori, che un MLP standard non puÃ2 catturare senza specifiche funzioni di ingegneria conspositive esplicite.

Reti neurali convoluzionali (CNN) per l'estrazione di caratteristiche spaziali

Le reti neurali convoluzionali sono diventate una pietra angolare della decodifica del segnale cerebrale, soprattutto per i dati EEG e ECoG. Le CNN applicano filtri imparabili attraverso le dimensioni spaziali o spatio-temporali dell'ingresso, preservando le relazioni locali, riducendo drasticamente il numero di parametri rispetto ad una rete completamente collegata.

EEGNet e ConvNet poco profondi/poco

Una delle architetture più influenti è EEGNet], una CNN compatta progettata specificamente per la classificazione EEGNet utilizza le convoluzioni in senso profondo e separabile per imparare i filtri spaziali specifici per soggetto, mantenendo il modello abbastanza leggero da formare su piccole caratteristiche di dataset.

Altre varianti CNN ampiamente utilizzate includono ]Shallow ConvNet e Deep ConvNet[, proposto da Schirrmeister et al. (2017). La variante bassa elabora EEG grezzo con una singola convoluzione temporale, un pool spaziale attraverso i canali e un ultimo strato denso.

CNN per la rilevazione di seizure e oltre

Nelle applicazioni cliniche, le CNN hanno dimostrato notevoli prestazioni nel rilevamento automatico delle convulsioni da registrazioni EEG continue. Trattando il segnale multicanale come immagine 2D (canali × time), una CNN può imparare a riconoscere le firme spatio-temporali di attività ictal e interictal.

Reti neurali ricorrenti (RNN) e LSTM per dinamiche temporali

I segnali di cervello sono intrinsecamente sequenziali: lo stato del cervello in tempo ] [FLT:]]]] è fortemente influenzato dalla sua storia recente. Le reti neurali ricorrenti (RNN) sono progettate per elaborare le sequenze mantenendo uno stato nascosto che viene aggiornato ad ogni passo.

LSTM per la classificazione EEG continua

Le funzioni LSTM sono state impiegate per compiti in cui il contesto temporale è fondamentale, come la classificazione del carico cognitivo, le fasi del sonno o il discorso immaginato dai micro-stato EEG. Ad esempio, nella messa a riposo, un segmento di 8 secondi di dati di polisomnografia può contenere modelli caratteristici che si evolvono nel corso dei minuti; un LSTM può codificare queste dipendenze a più lungo raggio.

Una delle sfide dell'uso di LSTM per segnali cerebrali è l'alta velocità di campionamento (spesso 250 Hz o superiore), che si traduce in sequenze di input molto lunghe. Per mitigare questo, molte architetture prima downsample il segnale grezzo o applicare un frontend convoluzionale per ridurre la risoluzione temporale prima di alimentare le caratteristiche agli strati ricorrenti.

GRU e RNN potenziate dall'attenzione

I GRU offrono un meccanismo di gating più semplice di LSTM, con meno parametri, e hanno mostrato prestazioni comparabili su molti dataset EEG. I ricercatori hanno anche aumentato le RNN con attenzione, permettendo alla rete di concentrarsi sui passi più informativi del tempo. Ad esempio, in un compito go‐/no-go, il modello può imparare a partecipare al momento della presentazione dello stimolo piuttosto che alla base di RNNping.

Trasformatori e Meccanismo di attenzione

L'architettura del trasformatore, originariamente sviluppata per la lavorazione del linguaggio naturale, è stata adattata per la decodifica del segnale cerebrale con risultati impressionanti. Al suo nucleo, il trasformatore sostituisce la ricorrenza con un meccanismo di autoattenzione [[]]]] che calcola le somme ponderate di tutte le posizioni di ingresso, permettendo al modello di catturare direttamente dipendenze a lungo raggio senza il collo di bottiglia sequenziale dei punti RNNs.

EEG‐Transformer e Varianti

Uno dei primi adattamenti è il EEG‐Transformer], che consente di gettare la serie multicanale in patch (ad esempio, finestre di 1 secondo) e quindi applica un trasformatore standard di sola encoder con sequenze di incorporazione posizionali.

Un'altra variante notevole è il Vision Transformer (ViT)] adattato per EEG trattando l'immagine 2D EEG (canali × time) come una griglia di patch. L'approccio ViT è stato utilizzato per il rilevamento di funzioni di sequestro e la classificazione del sonno.

Trasformatori multi-modulatori e cross-Attention

La decodifica del segnale cerebrale spesso beneficia di fondere molteplici modalità, come EEG e FMRI, o EEG e eye-tracking. I trasformatori supportano naturalmente gli input multi-modali utilizzando encoder separati per ogni modalità e quindi trasversalmente l'attenzione tra loro.

Architettura ibrida: Combinando CNN, RNN e Transformers

Non esiste una sola architettura che domina tutti i compiti di decodifica del segnale cerebrale. I modelli contemporanei più efficaci sono spesso ibridi che sfruttano i punti di forza di ogni blocco di edifici. Un tipico canale ibrido applica per primo una serie di strati convoluzionali per estrarre le caratteristiche spaziali locali (ad esempio, da montaggi elettrodi) e modelli temporali a breve termine (ad esempio, bande di frequenza).

CNN‐LSTM e CNN‐Transformer

Uno dei più efficaci framework ibridi è il CNN‐LSTM]. Ad esempio, nel pubblico BCI Competition IV dataset (2a), una CNN convoluzioni separabili a senso profondo seguite da un Bi‐LSTM ha raggiunto un valore kappa superiore a 0.70, significativamente superando una linea di base CNN-only.

Approcci di Ensemble e Multi-Scale

I modelli ibridi possono anche incorporare processi multi-scala. Ad esempio, un modello potrebbe elaborare il segnale a tre risoluzioni temporali (ad esempio, utilizzando downsampling da fattori di 2 e 4) e combinare le caratteristiche attraverso l'attenzione.

Le direzioni e le sfide aperte

Nonostante i progressi impressionanti, molte sfide rimangono prima che la decodifica della rete neurale dei segnali cerebrali diventi clinicamente e commercialmente fattibile.

Trasferimento di apprendimento e generalizzazione

La maggior parte dei modelli di apprendimento profondo sono formati e valutati su dati provenienti da un singolo soggetto (o da un piccolo coorte) e non riescono quando applicati a un nuovo utente. I metodi di apprendimento a basso rendimento mirano ad adattare un modello pre-trained ad un nuovo soggetto con una minima impostazione fine.

Imparare senza supervisione e auto-superviso

I dati relativi al segnale acustico sono costosi e richiedono tempo. I metodi non supervisionati e controllati da sé imparano rappresentazioni significative da segnali non labelled, che possono essere trasferiti a compiti a valle con meno etichette.

Ricodizionamento in tempo reale e a bassa efficienza

Per molte applicazioni BCI, come il controllo del cursore o gli arti neuroprotetici, la decodifica deve avvenire in tempo reale con una minima latenza. I grandi modelli di trasformatori possono essere computazionalmente esigenti. I ricercatori stanno esplorando architetture efficienti, tra cui ] le reti neurali dispianti che i neuroni biologici mimi e operano su dati basati sugli eventi, e ancora fattibile]

Spiegabilità e fiducia

I medici e gli utenti finali devono fidarsi di un sistema di decodifica, soprattutto quando influenza le decisioni mediche. I modelli di apprendimento profondo sono spesso chiamati scatole nere, ma il lavoro recente in AI spiegabile (XAI) per i segnali cerebrali ha prodotto mappe di salienza, propagazione di rilevanza a livello (LRP), e le visualizzazioni di attenzione che evidenziano quali punti di tempo o elettrodi il modello si sta concentrando su.

Modellazione multi-task e multi-soggetto

I modelli attuali sono solitamente formati per un singolo compito (ad esempio, l'immagine del motore o il rilevamento delle convulsioni). L'apprendimento multi-task, dove una rappresentazione condivisa è addestrata su diversi compiti correlati contemporaneamente, ha dimostrato la promessa di migliorare le prestazioni individuali del compito. Analogamente, i modelli multi-soggetto che imparano una rappresentazione anatomica e funzionale comune su argomenti potrebbero consentire il trasferimento zero-shot: decodificare un soggetto nuovo senza dati di calibrazione.

Conclusioni

Le architetture di rete neurali per la decodifica del segnale cerebrale si sono evolute da reti semplici completamente connesse a sofisticati ibridi di design convoluzionale, ricorrente e basato sull'attenzione. Le CNNs eccelleno a catturare i modelli spaziali; le dipendenze temporali del modello RNN e LSTM; i trasformatori forniscono un contesto globale potente e supportano la fusione multi-modale.