Table of Contents
Inleiding
Het ontcijferen van hersensignalen van niet-invasieve of invasieve opnames is een van de meest ambitieuze grenzen in de moderne computer neurowetenschappen. Electroencephalography (EEG), magnetoencefalografie (MEG), functionele magnetische resonantie imaging (fMRI), en elektrocorticography (ECOG) produceren hoge-dimensionale, lawaaierige en niet-stationaire stromen van gegevens. Het ontcijferen van de neurale code van dergelijke signalen heeft het potentieel om klinische diagnostiek, hersencomputer interfaces (BCI's) en neurorehabilitatie te revolutioneren. In het afgelopen decennium, diep leren . en in het bijzonder nieuwe neurale netwerkarchitecturen . heeft drastisch verbeterd de nauwkeurigheid, robuustheid en generalisatie van hersensignaal decoderingssystemen. Dit artikel onderzoekt de belangrijkste architectonische vooruitgang, van vroege multilayer perceptrons tot moderne transformatoren, en onderzoekt hoe elk paradigma de unieke uitdagingen van neurale gegevens aanpak.
Hersensignalen worden gekenmerkt door lage signaal-ruisverhoudingen, hoge intersubjectvariabiliteit en complexe spatio-temporale dynamiek. Traditionele machine learning pijpleidingen vereisen uitgebreide handgemaakte functie extractie, zoals vermogen spectrale dichtheden of gemeenschappelijke ruimtelijke patronen. Diep leren modellen, daarentegen, kunnen leren hiërarchieën van relevante kenmerken direct uit ruwe of minimaal pre-verwerkte opnames. Deze verschuiving heeft de state-of-the-art resultaten in beslag nemen detectie, motorische beeldvorming classificatie, slaap enscenering, en zelfs de decodering van ingebeelde spraak. De volgende secties geven de evolutie van netwerkarchitecturen weer die deze doorbraken mogelijk hebben gemaakt.
Traditionele Neurale netwerkbenaderingen
Vroege pogingen om neurale netwerken toe te passen op hersensignalen die gebaseerd zijn op multilayer perceptrons[ (MLP's). Deze volledig aangesloten feedforward netwerken nemen een vector van functies .. die typisch zijn ontworpen van het ruwe signaal .. en leren een niet-lineaire mapping naar een gewenste output. Voor EEG-gebaseerde BCI's, gemeenschappelijke kenmerken omvatten band-vermogen schattingen van meerdere frequentiebanden (delta, thèta, alfa, beta, gamma) en ruimtelijke filters afgeleid van gemeenschappelijke ruimtelijke patroon (CSP) algoritmen. Terwijl MLP's kunnen overtreffen lineaire classifiers zoals LDA of SVM in bepaalde taken, ze leden van verschillende fundamentele beperkingen wanneer toegepast op neurale gegevens.
Ten eerste behandelen MLP's inputfuncties als onafhankelijk, waarbij de ruimtelijke topologie van elektroden en de tijdorde van monsters worden genegeerd. Ten tweede groeit het aantal parameters snel met inputdimensiviteit, wat leidt tot een hoog risico op oversitting op de relatief kleine datasets die kenmerkend zijn voor BCI-experimenten (vaak minder dan duizend proeven per onderwerp). Ten derde zijn MLP's gevoelig voor lawaai en hebben ze een beperkte capaciteit om de hoge variatie, niet-stationaire dynamiek van hersensignalen te modelleren. Als gevolg daarvan, hoewel MLP's een proof-of-concept voor end-to-end geleerde decodering hebben opgeleverd, werd hun praktische nut omlijnd. Onderzoekers richtten zich al snel op architecturen die de inherente structuur van neurale opnames konden exploiteren.
Beperkingen van volledig verbonden netwerken
Naast de bovenstaande kwesties negeren volledig verbonden lagen de plaats van informatie. In een EEG montage registreren aangrenzende elektroden vaak de activiteit van de nabijgelegen corticale bronnen. Een convolutionele laag die deze lokale connectiviteit respecteert, kan een dergelijke ruimtelijke structuur veel efficiënter benutten. Ook de temporele opeenvolging van monsters bevat kritische informatie over event-gerelateerde potentials (ERP's) en oscillatoire fasedynamiek, die een standaard MLP niet kan vastleggen zonder expliciete tijdreeks functie engineering. Deze inzichten motiveerden de goedkeuring van convolutionaire en terugkerende ontwerpen.
Convolutional Neural Networks (CNNs) for Spatial Feature Extraction
Convolutionele neurale netwerken zijn een hoeksteen geworden van hersensignaaldecodering, vooral voor EEG- en ECoG-gegevens. CNNs gebruiken leerbare filters over de ruimtelijke of spatio-temporele dimensies van de input, behouden lokale relaties en drastisch verminderen het aantal parameters in vergelijking met een volledig verbonden netwerk. Twee grote families van CNN-architecturen zijn ontstaan: die welke 1D-convoluties gebruiken in de tijd (temporele convoluties) en die welke 2D-convoluties gebruiken over elektrodekanalen die in een 2D-netwerk (ruimtelijke convoluties) zijn gerangschikt. Veel succesvolle modellen combineren beide.
EEGNet en Shallow/Deep ConvNets
Een van de meest invloedrijke architecturen is EEGNet[], een compacte CNN die specifiek is ontworpen voor EEG-classificatie. EEGNet gebruikt diepte- en scheidbare convoluties om subjectspecifieke ruimtelijke filters te leren terwijl het model licht genoeg blijft om op kleine datasets te trainen. De architectuur bestaat uit een temporale convolution (om frequentiefilters te leren), gevolgd door een diepte-wise convolution over verschillende kanalen (om ruimtelijke patronen te leren), en vervolgens een scheidbare convolution om functiekaarten te combineren. EEGNet heeft aangetoond dat het concurrerende prestaties te bereiken over meerdere BCI-paradigma's (motorimagery, P300, fout-gerelateerde negativiteit) met slechts enkele duizenden parameters.
Andere veelgebruikte CNN varianten omvatten Shallow ConvNet[ en Deep ConvNet, voorgesteld door Schirrmeister et al. (2017). De ondiepe variant verwerkt ruwe EEG met een enkele temporale convolution, een ruimtelijke pooling over kanalen, en een laatste dichte laag. Het is effectief voor motorimage taken waar frequentie-band power changes prominent zijn. De diepe variant stapelt meerdere convolutionale blokken met batchnormalisatie, waardoor hogere nauwkeurigheid bereikt op complexere discriminatietaken, maar die meer gegevens nodig zijn om te trainen. Deze modellen zijn basislijnen geworden in veel BCI studies.
CNNs voor de detectie van toevallen en verder
In klinische toepassingen hebben CNNs opmerkelijke prestaties aangetoond bij de geautomatiseerde opsporing van aanvallen door continue EEG-opnamen. Door het multikanaalssignaal te behandelen als een 2D-beeld (kanalen × tijd), kan een CNN leren de spatio-temporale handtekeningen van ictale en interi-ctaal activiteit te herkennen. Uit grootschalige studies, zoals die met de Temple University Hospital EEG Dataset, is gebleken dat CNN-gebaseerde detectoren gevoeligheid en specificiteit kunnen bereiken van meer dan 90% terwijl ze in real-time werken. Ook zijn CNN's toegepast om trage-golfslaap te detecteren, medicatierespons te voorspellen en biomarkers voor aandoeningen zoals schizofrenie en Alzheimer.
Recurrent Neural Networks (RNNs) en LSTM for Temporal Dynamics
Hersensignalen zijn intrinsiek sequentiële: de toestand van de hersenen op het moment t wordt sterk beïnvloed door de recente geschiedenis. Recurrente neurale netwerken (RNN's) zijn ontworpen om sequenties te verwerken door een verborgen toestand te handhaven die op elk moment wordt bijgewerkt. Vroege RNN's worstelden met het -verdwijningsgradiëntprobleem[], waardoor ze niet precies het type structuur konden leren dat aanwezig is in event-gerelateerde potentiaal, trage oscillaties en motorische planningsactiviteiten. De introductie van ]Long Short-Term Memory[] (LSTM) en later ]Gated Recurrent Units[[[[FLT:]] (GRU's)) ging over deze kwestie door mechanismen in te voeren die de stroom van informatie beheersen.
LSTM's voor continue EEG-classificatie
LSTM's zijn ingezet voor taken waarbij de tijdscontext van het grootste belang is, zoals het classificeren van cognitieve belasting, slaapfasen of het verbeelden van spraak vanuit EEG-microstaten. Zo kan een 8-seconde segment polysomnografiegegevens kenmerkende patronen bevatten die zich in minuten ontwikkelen; een LSTM kan deze langere afstandsafhankelijkheden coderen. Bidirectionele LSTM's (Bi‐LSTM's) verbeteren de prestaties door het signaal zowel vooruit als achteruit te verwerken, waardoor functies die symmetrisch rond een gebeurtenis zijn effectief worden vastgelegd.
Een van de uitdagingen van het gebruik van LSTM's voor hersensignalen is de hoge bemonsteringssnelheid (vaak 250 Hz of hoger), wat resulteert in zeer lange invoersequenties. Om dit te beperken, nemen veel architecturen eerst een monster van het ruwe signaal of passen een convolutionaire frontend toe om de temporale resolutie te verminderen voordat de functies worden gevoed aan de terugkerende lagen. De combinatie van CNN en L AND . . een convL › ] . is bijzonder effectief geweest voor taken zoals motorimagery, waar de CNN uit elk kort tijdvenster en de L TS hun evolutie gedurende enkele seconden volgt. Een uitgebreide beoordeling van LSW‐based EEG-decodering is te vinden in dit 2021 onderzoek in Pattern Recogn .
GRU en Attentie-aangepaste RNN's
GRU's bieden een eenvoudiger stelmechanisme dan LSTM's, met minder parameters en hebben vergelijkbare prestaties op veel EEG-datasets getoond. Onderzoekers hebben ook RNN's met aandacht vergroot, zodat het netwerk zich kan concentreren op de meest informatieve tijdstappen. Bijvoorbeeld, in een go-/no-go taak, kan het model leren om het moment van stimuleringspresentatie te volgen in plaats van de basislijn die eraan vooraf gaat. Aandachtsmechanismen binnen RNN-kaders dienen vaak als een stap naar de volledig op aandacht gebaseerde transformatorarchitecturen die hierna worden beschreven.
Transformatoren en aandachtsmechanismen
De transformator architectuur, oorspronkelijk ontwikkeld voor natuurlijke taalverwerking, is aangepast voor hersensignaal decodering met indrukwekkende resultaten. In de kern vervangt de transformator een herhaling met een zelf-aandachtsmechanisme dat gewogen sommen van alle invoerposities berekent, waardoor het model directe langeafstandsafhankelijkheden kan vastleggen zonder de sequentiële knelpunt van RNN's. Voor EEG- en MEG-signalen kunnen transformatoren zowel ruimtelijke (over verschillende kanalen) als tijdelijke (over verschillende tijdpunten) relaties bijwonen, waardoor ze zeer expressief zijn.
EEG-Transformer en Varianten
Een van de vroegste aanpassingen is de EEG-Transformer[], die de multichannel tijdreeks in patches verzint (bijvoorbeeld 1‐seconde vensters) en vervolgens een standaard encoder-alleen transformator met positionale inbeddingen toepast. Deze architectuur heeft state-of-the-art resultaten bereikt op motorimago en emotie herkenning benchmarks. Om de computation complexiteit te verminderen, passen veel werken een convolutionale frontend toe om de sequentielengte vóór de transformatorlagen te verminderen.Het EEG-Transformer papier ] geeft een volledige beschrijving van het ontwerp.
Een andere opmerkelijke variant is de Vision Transformer (ViT)[] aangepast voor EEG door het 2D EEG-beeld (kanalen × tijd) als patchraster te behandelen. De VIT-benadering is gebruikt voor cross-subject opsporing van aanvallen en slaapfase classificatie. Recentere modellen, zoals SPEECH-TCNet en EEG-Conformer[], combineren convolutionele modules met transformatorkoppen om de lokale en mondiale extractie van kenmerken in evenwicht te brengen.
Multimodaal transformers en kruisaandacht
Decodering van het hersensignaal profiteert vaak van het gebruik van meerdere modaliteiten, zoals EEG en fMRI, of EEG en eye-tracking. Transformatoren ondersteunen van nature multimodale ingangen door gebruik te maken van afzonderlijke encoders voor elke modaliteit en vervolgens kruis-attending tussen hen. Zo gebruikte een recente studie over emotieherkenning een transformator om EEG-signalen en perifere fysiologische signalen (ECG, GS) via cross-modale aandacht te stoppen, waardoor een significant hogere nauwkeurigheid werd bereikt dan single-modality basislijnen. Dit paradigma belooft voor het bouwen van robuuste BCI's die werken in echte, luidruchtige omgevingen.
Hybride Architectures: CNNs, RNNs en Transformers combineren
Geen enkele architectuur domineert alle taken van het hersensignaaldecoderen. De meest effectieve hedendaagse modellen zijn vaak hybriden die de sterktes van elk bouwblok benutten. Een typische hybride pijpleiding past eerst een reeks convolutionaire lagen toe om lokale ruimtelijke kenmerken (bijvoorbeeld uit elektrodemontages) en tijdelijke kortstondige patronen (bv. frequentiebanden) te extraheren. De output van de CNN wordt vervolgens gevoed in een terugkerende of op aandacht gebaseerde module die langere afstand afhankelijkheden van elkaar vastlegt. Tenslotte zorgt een globale pooling of dichte laag voor de classificatie of regressie-output.
CNN‐LSTM en CNN‐Transformer
Een van de meest succesvolle hybride kaders is de CNN‐LSTM. Bijvoorbeeld, in de publieke BCI Competition IV dataset (2a), een CNN met diepte-wise scheidbare convoluties gevolgd door een Bi‐LSTM bereikte een kappa waarde boven 0,70, die een CNN‐only baseline significant overtreft. Evenzo is de CNN‐Transformer (soms de Conformer) toegepast op ruwe EEG voor spraakdecodering. De convolutionele frontend vermindert de opeenvolging lengte en verrijkt lokale kenmerken, terwijl de transformator de mondiale context vastlegt. Dit ontwerp is bijzonder effectief voor EEG-arrays met een hoge dichtheid (128 kanalen of meer).
Samenspel en multischaalbenaderingen
Hybride modellen kunnen ook multi-schaal verwerking omvatten. Bijvoorbeeld, een model zou het signaal kunnen verwerken op drie temporele resoluties (bijvoorbeeld, gebruik maken van downsampling door factoren van 2 en 4) en combineren van de functies via aandacht. Dit bootst de manier na waarop de hersenen zelf verwerkt informatie op meerdere tijdstippen, van snelle pieken tot trage corticale ritmes. Ensembles van diverse architecturen zijn ook gebruikt in BCI wedstrijden, hoewel ze komen ten koste van een verhoogde intreetijd . . een factor vaak cruciaal voor real-time systemen.
Toekomstige richtingen en Open uitdagingen
Ondanks de indrukwekkende vooruitgang, blijven er nog verschillende uitdagingen voordat neurale netwerk decodering van hersensignalen klinisch en commercieel levensvatbaar wordt.
Transfer Learning en generalisatie
Een belangrijk knelpunt is de slechte generalisatie over onderwerpen, sessies en apparaten. De meeste diepopgeleide modellen worden opgeleid en geëvalueerd op gegevens van één onderwerp (of kleine cohort) en falen wanneer ze op een nieuwe gebruiker worden toegepast. De methoden van Transfer learning zijn erop gericht een voorgetraind model aan te passen aan een nieuw onderwerp met minimale fine-tuning. De benaderingen omvatten domeinaanpassing (bijvoorbeeld het afstemmen van functieverdelingen via tegen- of gemiddelde discrepantie) en parameter-efficiënte fijnafstelling van grote basismodellen. Grote publieke datasets zoals TUH EEG en MNE‐Scan maken het mogelijk om algemene EEG-coders voor het gebruik van algemene aardse EEG-encoders, analoog aan BERT of GPT voor tekst, te pre-training te geven. Het "EEG‐BERT"voorstel]] is een vroeg voorbeeld van deze trend.
Niet-gesuperviseerde en zelf-ondersteund leren
De gegevens van het gelabelde hersensignaal zijn duur en tijdrovend om te verkrijgen. Onbeheerste en zelfcontroleerbare methoden leren zinvolle weergaven van niet-gelabelde signalen, die vervolgens kunnen worden overgedragen aan downstreamtaken met minder labels. Contrastief leren, voorspellende codering en gemaskerde autocodering zijn allemaal toegepast op EEG en MEG. Zo leert het SimCLR-EEG-raamwerk in verschillende variaties op ruis- en elektrodeverschuivingen, waardoor robuuste kenmerken voor de indeling van slaapfasen met minder dan 10% van de oorspronkelijke gelabelde gegevens mogelijk zijn. Deze richting is cruciaal voor het vergroten van de toepasbaarheid van diepe neurale netwerken in reële klinische omstandigheden.
Real-time en lage-rente-decodering
Voor veel BCI-toepassingen, zoals cursorbesturing of neuroprotetische ledematen, moet de decodering in real time plaatsvinden met minimale latentie. Grote transformatormodellen kunnen rekenend veeleisend zijn. Onderzoekers onderzoeken efficiënte architecturen, waaronder [spiking neurale netwerken[] die biologische neuronen nabootsen en werken op event-gebaseerde data, en kennisdistillatie[] grote modellen comprimeren in lichtgewicht versies die geschikt zijn voor mobiele of embedded hardware. Daarnaast beloven neuromorfe chips (bijvoorbeeld Intel Loihi, Brainchip Akida) om hersensignaaldecodering op extreem lage kracht te laten uitvoeren, waardoor draagbare BCI's haalbaar zijn.
Verklaarbaarheid en vertrouwen
Klinieken en eindgebruikers moeten vertrouwen hebben in een decoderend systeem, vooral wanneer het invloed heeft op medische beslissingen. Diep lerende modellen worden vaak zwarte dozen genoemd, maar recent werk in verklarende AI (XAI) voor hersensignalen heeft saliëncy kaarten, laag-wise relevantie propagation (LRP) en aandacht visualisaties die de aandacht vestigen op welke tijdpunten of elektroden het model zich richt op. Deze verklaringen bouwen niet alleen vertrouwen op, maar kunnen ook fysiologisch relevante kenmerken onthullen . Bijvoorbeeld, dat een detector zich richt op een specifieke frequentieband of een bepaald hersengebied. onuitgegeven evaluatie van de verklaringsmethoden voor neurale decodering is een actief onderzoeksgebied.
Multi-task- en multi-subjectmodellering
De huidige modellen worden meestal getraind voor één taak (bijvoorbeeld motorische beeldvorming of opsporing van aanvallen). Multitask learning, waarbij een gedeelde vertegenwoordiging wordt getraind op verschillende gerelateerde taken tegelijkertijd, heeft belofte getoond voor het verbeteren van de individuele taakprestaties. Ook multi-subject modellen die een gemeenschappelijke anatomische en functionele representatie leren over onderwerpen zou kunnen maken nul-shot overdracht: decoderen van een nieuw onderwerp zonder enige kalibratiegegevens. Dit zou een paradigmaverschuiving voor BCI's zijn, waardoor de vervelende kalibratiesessies die momenteel nodig zijn, worden geëlimineerd.
Conclusie
Neurale netwerkarchitecturen voor het ontcijferen van hersensignalen zijn geëvolueerd van eenvoudige volledig aangesloten netwerken tot geavanceerde hybriden van convolutionele, terugkerende en op aandacht gebaseerde ontwerpen. CNNs blinken uit in het vastleggen van ruimtelijke patronen; RNN's en LSTM's model temporele afhankelijkheden; transformatoren bieden krachtige wereldwijde context en ondersteunen multimodale fusie. De meest effectieve moderne modellen combineren deze elementen, vaak met overdracht en zelf-gezagsleren om dataschaarste te overwinnen. Uitdagingen zoals generalisatie, real-time prestaties en interpreteerbaarheid blijven bestaan, maar het tempo van innovatie wordt versneld. Aangezien grotere gelabelde datasets en computerbronnen beschikbaar komen, kunnen we verwachten dat neurale netwerkdecoders een standaardinstrument worden in neurowetenschapsonderzoek en een sleutelcomponent van de volgende generatie brain-computer interfaces. Het uiteindelijke doel .