Einleitung

Die Decodierung von Gehirnsignalen aus nicht-invasiven oder invasiven Aufnahmen ist eine der ehrgeizigsten Grenzen der modernen Computerneurologie. Elektroenzephalographie (EEG), Magnetenzephalographie (MEG), funktionelle Magnetresonanztomographie (fMRI) und Elektrokortikographie (ECoG) erzeugen hochdimensionale, laute und nicht-stationäre Datenströme. Die Entschlüsselung des neuronalen Codes aus solchen Signalen hat das Potenzial, die klinische Diagnostik, Gehirn-Computer-Schnittstellen (BCI) und Neurorehabilitation zu revolutionieren. In den letzten zehn Jahren hat Deep Learning - und insbesondere neuartige neuronale Netzwerkarchitekturen - die Genauigkeit, Robustheit und Generalisierung von Gehirnsignal-Dekodierungssystemen dramatisch verbessert. Dieser Artikel untersucht die wichtigsten architektonischen Fortschritte, von frühen Multilayer-Perzeptronen bis hin zu modernen Transformatoren und untersucht, wie jedes Paradigma die einzigartigen Herausforderungen von neuronalen Daten anspricht.

Hirnsignale zeichnen sich durch niedrige Signal-Rausch-Verhältnisse, hohe Intersubjektvariabilität und komplexe räumlich-zeitliche Dynamik aus. Traditionelle Machine-Learning-Pipelines erforderten eine umfangreiche handgefertigte Merkmalsextraktion, wie spektrale Leistungsdichten oder gemeinsame räumliche Muster. Deep-Learning-Modelle können dagegen Hierarchien relevanter Merkmale direkt aus rohen oder minimal vorverarbeiteten Aufnahmen lernen. Diese Verschiebung hat State-of-the-Art-Ergebnisse in der Anfallserkennung, der Klassifizierung motorischer Bilder, der Schlafstaging und sogar der Dekodierung von imaginärer Sprache ermöglicht. In den folgenden Abschnitten wird die Entwicklung von Netzwerkarchitekturen detailliert beschrieben, die diese Durchbrüche ermöglicht haben.

Traditionelle neuronale Netzwerkansätze

Frühe Versuche, neuronale Netze auf Gehirnsignale anzuwenden, beruhten auf mehrschichtigen Perzepttronen (MLPs). Diese vollständig verbundenen Feedforward-Netzwerke nehmen einen Vektor von Merkmalen - typischerweise aus dem Rohsignal - und lernen eine nichtlineare Abbildung zu einem gewünschten Ausgang. Für EEG-basierte BCIs umfassten gemeinsame Merkmale Bandleistungsschätzungen aus mehreren Frequenzbändern (Delta, Theta, Alpha, Beta, Gamma) und räumliche Filter, die aus gemeinsamen räumlichen Mustern abgeleitet wurden Algorithmen. Während MLPs lineare Klassifikatoren wie LDA oder SVM in bestimmten Aufgaben übertreffen konnten, litten sie unter mehreren grundlegenden Einschränkungen, wenn sie auf neuronale Daten angewendet wurden.

Erstens behandeln MLPs Eingabemerkmale als unabhängig, wobei sie die räumliche Topologie der Elektroden und die zeitliche Anordnung der Proben ignorieren. Zweitens wächst die Anzahl der Parameter mit der Eingabedimensionalität schnell, was zu einem hohen Risiko führt, dass die für BCI-Experimente typischen relativ kleinen Datensätze überpassen (oft weniger als tausend Studien pro Probanden). Drittens sind MLPs empfindlich gegenüber Rauschen und zeigen eine begrenzte Fähigkeit, die hochvarianzreiche, nichtstationäre Dynamik von Gehirnsignalen zu modellieren.

Grenzen von vollständig vernetzten Netzwerken

Über die oben genannten Probleme hinaus ignorieren vollständig verbundene Schichten die Lokalität von Informationen. Bei einer EEG-Montage erfassen benachbarte Elektroden häufig korrelierte Aktivitäten aus nahe gelegenen kortikalen Quellen. Eine Faltungsschicht, die diese lokale Konnektivität respektiert, kann eine solche räumliche Struktur viel effizienter nutzen. Ebenso enthält die zeitliche Abfolge von Proben kritische Informationen über ereignisbezogene Potentiale (ERPs) und oszillatorische Phasendynamik, die ein Standard-MLP ohne explizite Zeitreihen-Feature-Engineering nicht erfassen kann. Diese Erkenntnisse motivierten die Annahme von Faltungs- und wiederkehrenden Designs.

Convolutional Neural Networks (CNNs) für die räumliche Merkmalsextraktion

Faltungsneurale Netze sind zu einem Eckpfeiler der Signaldekodierung im Gehirn geworden, insbesondere für EEG- und ECoG-Daten. CNNs wenden lernbare Filter über die räumlichen oder räumlich-zeitlichen Dimensionen des Eingangs an, bewahren lokale Beziehungen und reduzieren gleichzeitig die Anzahl der Parameter im Vergleich zu einem vollständig verbundenen Netzwerk drastisch. Zwei Hauptfamilien von CNN-Architekturen sind entstanden: solche, die 1D-Faltung im Laufe der Zeit (zeitliche Faltung) verwenden, und solche, die 2D-Faltung über Elektrodenkanäle verwenden, die in einem 2D-Raster angeordnet sind (räumliche Faltung). Viele erfolgreiche Modelle kombinieren beide.

EEGNet und Shallow/Deep ConvNets

Eine der einflussreichsten Architekturen ist EEGNet, ein kompaktes CNN, das speziell für die EEG-Klassifikation entwickelt wurde. EEGNet verwendet tiefen- und trennbare Faltungen, um fachspezifische räumliche Filter zu lernen, während das Modell leicht genug ist, um auf kleinen Datensätzen zu trainieren. Die Architektur besteht aus einer zeitlichen Faltung (um Frequenzfilter zu lernen), gefolgt von einer tiefen Faltung über Kanäle (um räumliche Muster zu lernen) und dann einer trennbaren Faltung, um Feature-Maps zu kombinieren. EEGNet hat gezeigt, dass es eine wettbewerbsfähige Leistung über mehrere BCI-Paradigmen (Motorbilder, P300, fehlerbezogene Negativität) mit nur wenigen tausend Parametern erreicht. Das originale EEGNet-Papier bietet detaillierte Benchmarks.

Weitere weit verbreitete CNN-Varianten sind Shallow ConvNet und Deep ConvNet, vorgeschlagen von Schirrmeister et al. (2017). Die flache Variante verarbeitet rohes EEG mit einer einzigen zeitlichen Faltung, einer räumlichen Bündelung über Kanäle hinweg und einer abschließenden dichten Schicht. Sie ist wirksam für motorische Bildgebungsaufgaben, bei denen Frequenzband-Leistungsänderungen prominent sind. Die tiefe Variante stapelt mehrere Faltungsblöcke mit Batch-Normalisierung, wodurch eine höhere Genauigkeit bei komplexeren Diskriminierungsaufgaben erreicht wird, die jedoch mehr Daten erfordern. Diese Modelle sind in vielen BCI-Studien zu Basislinien geworden.

CNNs für die Seizure Detection und darüber hinaus

In klinischen Anwendungen haben CNNs eine bemerkenswerte Leistung bei der automatisierten Anfallserkennung durch kontinuierliche EEG-Aufnahmen gezeigt. Durch die Behandlung des Mehrkanalsignals als 2D-Bild (Kanäle × Zeit) kann ein CNN lernen, die räumlich-zeitlichen Signaturen von iktaler und interiktaler Aktivität zu erkennen. Groß angelegte Studien, wie die mit dem EEG-Datensatz des Temple University Hospital, haben gezeigt, dass CNN-basierte Detektoren in Echtzeit eine Empfindlichkeit und Spezifität von über 90% erreichen können. In ähnlicher Weise wurden CNNs eingesetzt, um den Schlaf in langsamen Wellen zu erkennen, die Reaktion von Medikamenten vorherzusagen und Biomarker für Erkrankungen wie Schizophrenie und Alzheimer zu identifizieren.

Recurrent Neural Networks (RNNs) und LSTM für Temporale Dynamik

Gehirnsignale sind intrinsisch sequenziell: Der Zustand des Gehirns zum Zeitpunkt t wird stark von seiner jüngeren Geschichte beeinflusst. Recurrent neural networks (RNNs) sind so konzipiert, dass Sequenzen durch Aufrechterhaltung eines versteckten Zustands verarbeitet werden, der bei jedem Zeitschritt aktualisiert wird. Early RNNs kämpften mit dem -Verschwindungsgradientenproblem, das sie daran hinderte, langfristige Abhängigkeiten zu lernen - genau die Art der Struktur, die in ereignisbezogenen Potentialen, langsamen Oszillationen und motorischer Planungsaktivität vorhanden ist. Die Einführung von Long Short-Term Memory (LSTM) und später Gated Recurrent Units (GRUs) befasste sich mit diesem Problem durch die Einbeziehung von Gating-Mechanismen, die den Informationsfluss steuern.

LSTMs für die kontinuierliche EEG-Klassifizierung

LSTMs wurden für Aufgaben eingesetzt, bei denen der zeitliche Kontext im Vordergrund steht, wie z. B. die Klassifizierung kognitiver Belastungen, Schlafphasen oder imaginäre Sprache aus EEG-Mikrozuständen. Zum Beispiel kann ein 8-Sekunden-Segment von Polysomnographiedaten charakteristische Muster enthalten, die sich über Minuten entwickeln; ein LSTM kann diese Abhängigkeiten mit größerer Reichweite codieren. Bidirektionale LSTMs (Bi-LSTMs) verbessern die Leistung weiter, indem sie das Signal sowohl vorwärts als auch rückwärts in der Zeit verarbeiten und effektiv Merkmale erfassen, die um ein Ereignis symmetrisch sind.

Eine der Herausforderungen bei der Verwendung von LSTMs für Gehirnsignale ist die hohe Abtastrate (oft 250 Hz oder höher), die zu sehr langen Eingabesequenzen führt. Um dies zu mildern, nehmen viele Architekturen zuerst das Rohsignal herunter oder wenden ein konvolutionales Frontend an, um die zeitliche Auflösung zu reduzieren, bevor die Merkmale den wiederkehrenden Schichten zugeführt werden. Die Kombination von CNN und LSTM - eine convLSTM - war besonders effektiv für Aufgaben wie motorische Bilder, bei denen das CNN räumliche Muster aus jedem kurzen Zeitfenster extrahiert und das LSTM ihre Entwicklung über mehrere Sekunden verfolgt. Eine umfassende Überprüfung der LSTM-basierten EEG-Dekodierung findet sich in dieser Umfrage im Jahr 2021 in Pattern Recognition.

GRU und Aufmerksamkeitserweiterte RNNs

GRU bieten einen einfacheren Gating-Mechanismus als LSTMs mit weniger Parametern und haben bei vielen EEG-Datensätzen eine vergleichbare Leistung gezeigt. Forscher haben RNNs auch mit Aufmerksamkeit erweitert, so dass sich das Netzwerk auf die informativsten Zeitschritte konzentrieren kann. In einer Go-/No-Go-Aufgabe kann das Modell beispielsweise lernen, sich auf den Moment der Reizpräsentation zu konzentrieren, anstatt auf die zugrunde liegende Linie. Aufmerksamkeitsmechanismen innerhalb von RNN-Frameworks dienen oft als Sprungbrett für die als nächstes beschriebenen vollauf aufmerksamkeitsbasierten Transformatorarchitekturen.

Transformer und Aufmerksamkeitsmechanismen

Die ursprünglich für die Verarbeitung natürlicher Sprache entwickelte Transformatorarchitektur wurde mit beeindruckenden Ergebnissen für die Gehirnsignaldecodierung angepasst. Im Kern ersetzt der Transformator die Wiederholung durch einen Selbstaufmerksamkeitsmechanismus, der gewichtete Summen aller Eingangspositionen berechnet und es dem Modell ermöglicht, Abhängigkeiten über große Entfernungen ohne den sequentiellen Engpass von RNNs direkt zu erfassen. Für EEG- und MEG-Signale können Transformatoren sowohl räumliche (kanalübergreifend) als auch zeitliche (zeitübergreifend) Beziehungen pflegen, was sie sehr ausdrucksstark macht.

EEG‐Transformator und Varianten

Eine der frühesten Anpassungen ist der EEG-Transformer, der die mehrkanaligen Zeitreihen in Patches (z. B. 1 Sekunde Fenster) tokenisiert und dann einen Standard-Encoder-only-Transformator mit Positionseinbettungen anwendet. Diese Architektur erzielte State-of-the-Art-Ergebnisse auf Motorbilder und Emotionserkennungs-Benchmarks. Um die Rechenkomplexität zu reduzieren, wenden viele Arbeiten ein Convolutional-Frontend an, um die Sequenzlänge vor den Transformatorschichten zu reduzieren. Das EEG-Transformer-Papier bietet eine vollständige Beschreibung des Designs.

Eine weitere bemerkenswerte Variante ist der Vision Transformer (ViT), der durch die Behandlung des 2D-EEG-Bildes (Kanäle × Zeit) als Patch-Raster für EEG-Systeme angepasst wurde. Der ViT-Ansatz wurde für die subjektübergreifende Anfallserkennung und Schlafstufenklassifizierung verwendet. Neuere Modelle wie SPEECH‐TCNet und EEG‐Conformer kombinieren Faltungsmodule mit Transformatorköpfen, um die lokale und globale Merkmalsextraktion auszugleichen.

Multi-Modal-Transformatoren und Cross-Attention

Die Dekodierung von Gehirnsignalen profitiert oft von der Fusion mehrerer Modalitäten wie EEG und fMRI oder EEG und Eye-Tracking. Transformer unterstützen natürlich multimodale Eingaben, indem sie für jede Modalität separate Encoder verwenden und dann zwischen ihnen kreuzen. So wurde in einer aktuellen Studie zur Emotionserkennung ein Transformator verwendet, um EEG-Signale und periphere physiologische Signale (EKG, GSR) über kreuzmodale Aufmerksamkeit zu verschmelzen, wodurch eine deutlich höhere Genauigkeit erreicht wird als die Basislinien für Single-Modalität. Dieses Paradigma ist vielversprechend für den Aufbau robuster BCIs, die in realen, lauten Umgebungen funktionieren.

Hybridarchitekturen: Kombination von CNNs, RNNs und Transformern

Keine einzelne Architektur dominiert alle Aufgaben der Gehirnsignal-Dekodierung. Die effektivsten modernen Modelle sind oft Hybride, die die Stärken jedes Bausteins ausnutzen. Eine typische Hybrid-Pipeline verwendet zunächst einen Satz von Faltungsschichten, um lokale räumliche Merkmale (z. B. aus Elektrodenmontagen) und kurzfristige zeitliche Muster (z. B. Frequenzbänder) zu extrahieren. Die Ausgabe des CNN wird dann in ein wiederkehrendes oder aufmerksamkeitsbasiertes Modul eingespeist, das Abhängigkeiten größerer Reichweite erfasst. Schließlich erzeugt eine globale Pooling- oder dichte Schicht die Klassifikations- oder Regressionsausgabe.

CNN‐LSTM und CNN‐Transformator

Eines der erfolgreichsten Hybrid-Frameworks ist das CNN‐LSTM. Beispielsweise erreichte ein CNN mit tief trennbaren Falten (2a) mit einem Bi‐LSTM einen Kappa-Wert von über 0,70 und damit eine deutliche Überholung gegenüber der Basislinie von CNN. Ebenso wurde der CNN‐Transformer (manchmal auch als Conformer bezeichnet) auf das Roh-EEG zur Sprachdecodierung angewendet. Das konvolutionale Frontend reduziert die Sequenzlänge und bereichert lokale Merkmale, während der Transformator den globalen Kontext erfasst. Dieses Design ist besonders effektiv für EEG-Arrays mit hoher Dichte (128 Kanäle oder mehr).

Ensemble und Multi-Scale-Ansätze

Hybridmodelle können auch eine mehrskalige Verarbeitung beinhalten. Ein Modell könnte beispielsweise das Signal in drei zeitlichen Auflösungen verarbeiten (z. B. durch Downsampling nach Faktoren 2 und 4) und die Merkmale durch Aufmerksamkeit kombinieren. Dies ahmt die Art und Weise nach, wie das Gehirn selbst Informationen in mehreren Zeitskalen verarbeitet, von schnellen Spikings bis hin zu langsamen kortikalen Rhythmen. Ensembles verschiedener Architekturen wurden auch in BCI-Wettbewerben verwendet, obwohl sie mit einer erhöhten Inferenzzeit einhergehen - ein Faktor, der oft für Echtzeitsysteme entscheidend ist.

Zukünftige Richtungen und offene Herausforderungen

Trotz der beeindruckenden Fortschritte bleiben mehrere Herausforderungen bestehen, bevor die Dekodierung neuronaler Netzwerke von Gehirnsignalen klinisch und kommerziell machbar wird.

Transfer Learning und Generalisierung

Ein großer Engpass ist die schlechte Verallgemeinerung über Fächer, Sitzungen und Geräte. Die meisten Deep-Learning-Modelle werden auf Daten eines einzelnen Fächers (oder einer kleinen Kohorte) trainiert und ausgewertet und scheitern, wenn sie auf einen neuen Benutzer angewendet werden. Transfer Learning Methoden zielen darauf ab, ein vortrainiertes Modell mit minimaler Feinabstimmung an ein neues Fächer anzupassen. Ansätze umfassen Domänenadaption (z. B. Ausrichtung von Merkmalsverteilungen durch gegnerisches Training oder maximale mittlere Diskrepanz) und parametereffiziente Feinabstimmung von großen Stiftungsmodellen. Große öffentliche Datensätze wie TUH EEG und MNE‐Scan ermöglichen die Vorschulung von universellen EEG-Encodern, analog zu BERT oder GPT für Text. Der „EEG‐BERT-Vorschlag ist ein frühes Beispiel für diesen Trend.

Unüberwachtes und selbstüberwachtes Lernen

Beschriftete Gehirnsignaldaten sind teuer und zeitaufwendig zu erfassen. Unüberwachte und selbstüberwachte Methoden lernen aussagekräftige Darstellungen aus nicht markierten Signalen, die dann mit weniger Markierungen auf nachgelagerte Aufgaben übertragen werden können. Kontrastives Lernen, prädiktive Codierung und maskierte Autoencodierung wurden alle auf EEG und MEG angewendet. Zum Beispiel lernt das SimCLR-EEG Invarianzen zu Rauschen und Elektrodenverschiebungen, was robuste Merkmale für die Klassifizierung von Schlafphasen mit weniger als 10% der ursprünglichen markierten Daten ermöglicht. Diese Richtung ist entscheidend für die Erweiterung der Anwendbarkeit von tiefen neuronalen Netzwerken in der realen Welt klinische Einstellungen.

Echtzeit- und Low-Latency-Decodierung

Für viele BCI-Anwendungen wie Cursorsteuerung oder neuroprothetische Gliedmaßen muss die Dekodierung in Echtzeit mit minimaler Latenz erfolgen. Große Transformatormodelle können rechentechnisch anspruchsvoll sein. Forscher erforschen effiziente Architekturen, einschließlich spiking neuronale Netze, die biologische Neuronen nachahmen und auf ereignisbasierten Daten arbeiten, und knowledge distillation, um große Modelle in leichte Versionen zu komprimieren, die für mobile oder eingebettete Hardware geeignet sind. Darüber hinaus versprechen neuromorphe Chips (z. B. Intel Loihi, Brainchip Akida), die Gehirnsignaldekodierung mit extrem geringer Leistung auszuführen, so dass tragbare BCIs möglich werden.

Erklärbarkeit und Vertrauen

Kliniker und Endanwender müssen einem Decodierungssystem vertrauen, insbesondere wenn es medizinische Entscheidungen beeinflusst. Deep Learning-Modelle werden oft als Blackboxen bezeichnet, aber die jüngsten Arbeiten zur Erklärbaren KI (XAI) für Gehirnsignale haben Salienzkarten, schichtweise Relevanzausbreitung (LRP) und Aufmerksamkeitsvisualisierungen hervorgebracht, die hervorheben, auf welche Zeitpunkte oder Elektroden sich das Modell konzentriert. Solche Erklärungen können nicht nur Vertrauen aufbauen, sondern auch physiologisch relevante Merkmale aufzeigen, beispielsweise dass ein Detektor sich auf ein bestimmtes Frequenzband oder eine bestimmte Gehirnregion konzentriert.

Multi-Task und Multi-Subject Modelling

Aktuelle Modelle werden in der Regel für eine einzelne Aufgabe (z. B. motorische Bilder oder Anfallserkennung) trainiert. Multi-Task-Learning, bei dem eine gemeinsame Repräsentation gleichzeitig auf mehrere verwandte Aufgaben trainiert wird, hat sich als vielversprechend für die Verbesserung der Leistung einzelner Aufgaben erwiesen. In ähnlicher Weise könnten Multi-Subjekt-Modelle, die eine gemeinsame anatomische und funktionale Repräsentation über Probanden hinweg lernen, eine Null-Schuss-Übertragung ermöglichen: Dekodierung eines neuen Subjekts ohne Kalibrierdaten. Dies wäre ein Paradigmenwechsel für BCIs, wodurch die derzeit erforderlichen langwierigen Kalibriersitzungen eliminiert würden.

Schlussfolgerung

Neuronale Netzwerkarchitekturen für die Gehirnsignal-Dekodierung haben sich von einfachen, vollständig verbundenen Netzwerken zu anspruchsvollen Hybriden aus konvolutionalen, rezidivierenden und aufmerksamkeitsbasierten Designs entwickelt. CNNs zeichnen sich durch die Erfassung räumlicher Muster aus; RNNs und LSTMs Modell zeitliche Abhängigkeiten; Transformatoren bieten einen leistungsstarken globalen Kontext und unterstützen die multimodale Fusion. Die effektivsten modernen Modelle kombinieren diese Elemente, oft mit Transfer und selbstüberwachtem Lernen, um Datenknappheit zu überwinden. Herausforderungen wie Generalisierung, Echtzeitleistung und Interpretierbarkeit bleiben bestehen, aber das Innovationstempo beschleunigt sich. Mit größeren markierten Datensätzen und Rechenressourcen können wir erwarten, dass neuronale Netzwerk-Dekodierer ein Standardwerkzeug in der neurowissenschaftlichen Forschung und eine Schlüsselkomponente der nächsten Generation werden Gehirn-Computer-Schnittstellen. Das ultimative Ziel - ein robuster, echtzeit- und fachunabhängiger Decoder - ist in Reichweite.