Table of Contents
Introducción
La definición de las señales cerebrales de las grabaciones no invasivas o invasivas es una de las fronteras más ambiciosas de la neurociencia computacional moderna. Electroencephalography (EEG), magnetoencephalography (MEG), resonancia magnética funcional (fMRI), y electrocorticografía (ECoG) producen flujos de datos de alta dimensión, no compisy y no estacionarios.
Las señales cerebrales se caracterizan por bajas proporciones de señal a ruido, alta variabilidad entre subjetos y complejas dinámicas espacio-temporales. Los conductos de aprendizaje automático tradicionales requieren una amplia extracción de características artesanales, como densidades espectrales de potencia o patrones espaciales comunes. Los modelos de aprendizaje profundo, por contraste, pueden aprender jerarquías de características relevantes directamente desde las grabaciones de estado de detección de estado en bruto o mínimamente preprocesado.
Enfoques tradicionales de la red neuronal
Los primeros intentos de aplicar redes neuronales a señales cerebrales se basaron en perceptrones multicapa (MLPs). Estas redes de alimentación totalmente conectadas toman un vector de características – generalmente diseñadas desde la señal cruda – y aprenden una asignación no lineal a una salida deseada. Para los BCIs basados en EEG, las características comunes incluyen las estimaciones de potencia de bandas espaciales
Primero, los MLP tratan las características de entrada como independientes, ignorando la topología espacial de los electrodos y el orden temporal de las muestras. Segundo, el número de parámetros crece rápidamente con la dimensionalidad de entrada, lo que conduce a un alto riesgo de sobreajustar los conjuntos de datos relativamente pequeños típicos de los experimentos de BCI (a menudo menos de mil ensayos por sujeto).
Limitaciones de redes totalmente conectadas
Más allá de los temas anteriores, capas totalmente conectadas ignoran la localidad de la información. En un montaje de EEG, electrodos adyacentes a menudo registran la actividad correlativa de fuentes corticales cercanas. Una capa convocional que respeta esta conectividad local puede aprovechar esta estructura espacial mucho más eficientemente. Asimismo, la sucesión temporal de muestras contiene información crítica sobre los potenciales relacionados con eventos (ERPs) y dinámicas de fase oscilatorias, que un MLP estándar no puede capturar sin tiempo explícito.
Redes Neurales Convocionales (CNN) para la Extracción de Característica Espacial
Las redes neuronales convolutivas se han convertido en una piedra angular de la decodificación de señales cerebrales, especialmente para datos EEG y ECoG. Las CNN aplican filtros aprendiz a través de las dimensiones espaciales o espaciales de la entrada, preservando las relaciones locales al reducir drásticamente el número de parámetros en comparación con una red totalmente conectada. Dos familias principales de arquitecturas CNN han surgido: las que utilizan convoluciones 1D con el tiempo (modelos con éxito) y las dos revoluciones con éxito
EEGNet y Shallow/Deep ConvNets
Una de las arquitecturas más influyentes es EEGNet, un CNN compacto diseñado específicamente para la clasificación EEG. La EEGNet utiliza convoluciones de profundidad y separación para aprender filtros espaciales específicos de sujeto, manteniendo el modelo lo suficientemente claro como para entrenar en pequeños conjuntos de datos.
Otros cambios de la versión de la BNN son: ConvNet] y Deep ConvNet], propuestos por Schirrmeister et al. (2017). La variante poco profunda procesa el EEG con una sola convolución temporal, una unión espacial a través de canales y una capa densa final.
CNNs for Seizure Detection and Beyond
En aplicaciones clínicas, las CNN han demostrado un rendimiento notable en la detección automatizada de convulsiones de las grabaciones continuas de EEG. Al tratar la señal multicanal como una imagen 2D (canallas × tiempo), una CNN puede aprender a reconocer las firmas de spatio-temporal de actividad ictal e interictal. Estudios a gran escala, como los que utilizan el Temple University EEG Dataset, han demostrado que los detectores basados en CNN pueden alcanzar sensibilidad y biomarcación de alta
Redes Neurales Recurrentes (RNNs) y LSTM para Dinámica Temporal
[LT] La estructura de la memoria [FLT] está fuertemente influenciada por su historia reciente. Las redes neuronales recurrentes (RNN) están diseñadas para procesar secuencias manteniendo un estado oculto que se actualiza en cada paso del tiempo.
LSTMs para la clasificación continua de EEG
Los LSTMs han sido empleados para tareas en las que el contexto temporal es primordial, como clasificar la carga cognitiva, las etapas del sueño o el discurso imaginado de micro-estados EEG. Por ejemplo, en el estadificación del sueño, un segmento de 8 segundos de datos de polisomnografía puede contener patrones característicos que evolucionan a través de minutos; un LSTM puede codificar estas dependencias de largo alcance.
Una de las dificultades de usar LSTMs para señales cerebrales es la alta tasa de muestreo (a menudo 250 Hz o superior), que resulta en secuencias de entrada muy largas. Para mitigar esto, muchas arquitecturas primero despliegan la señal cruda o aplican una ventana convocional para reducir la resolución temporal antes de alimentar las características a las capas recurrentes.
GRU y RNNs aumentadas de atención
Los GRU ofrecen un mecanismo de medición más simple que los LSTMs, con menos parámetros, y han mostrado un rendimiento comparable en muchos conjuntos de datos EEG. Los investigadores también han aumentado RNNs con atención, permitiendo que la red se centre en los pasos más informativos del tiempo. Por ejemplo, en una tarea de ir-/no-go, el modelo puede aprender a asistir al momento de la presentación de estímulo en lugar de servir el siguiente paso de referencia.
Transformadores y Mecanismos de Atención
La arquitectura transformadora, desarrollada originalmente para el procesamiento de lenguaje natural, ha sido adaptada para la decodificación de señales cerebrales con resultados impresionantes. En su núcleo, el transformador reemplaza la recurrencia con un mecanismo de autoatención que computa sumas ponderadas de todas las posiciones de entrada, permitiendo que el modelo captura directamente dependencias de largo alcance sin el consiguiente cuello de señales temporales.
EEG‐Transformer and Variants
Una de las adaptaciones más tempranas es el EEG‐Transformer, que muestra la serie de tiempo multicanal en parches (por ejemplo, ventanas de 1 segundo) y luego aplica un transformador estándar con embeddings posicional. Esta arquitectura logró resultados de última generación en imagen motor y reconocimiento de emoción de referencias.
Otra variante notable es el Transformador de Visión (ViT) adaptado para EEG mediante el tratamiento de la imagen 2D EEG (canallas × tiempo) como una red de parches. El enfoque ViT se ha utilizado para la detección de convulsiones y clasificación de estadios de sueño.
Transformadores multi-modales y atención cruzada
La decodificación de señales cerebrales se beneficia a menudo de fusionar múltiples modalidades, como el EEG y el fMRI, o el EEG y el seguimiento de ojos. Los transformadores soportan naturalmente entradas multimodales utilizando encoders separados para cada modalidad y luego interrelacionados entre ellos. Por ejemplo, un estudio reciente sobre el reconocimiento de emociones utilizó un transformador para fusionar señales EEG y señales fisiológicas periféricas (ECG, GSR) mediante un trabajo de referencias.
Arquitecturas híbridas: Combinando CNNs, RNNs y Transformers
Ninguna arquitectura única domina todas las tareas de decodificación de señales cerebrales. Los modelos contemporáneos más eficaces son a menudo híbridos que explotan las fortalezas de cada bloque de edificio. Un conducto híbrido típico primero aplica un conjunto de capas convocionales para extraer características espaciales locales (por ejemplo, de montajes electrodos) y patrones temporales a corto plazo (por ejemplo, bandas de frecuencia). La salida de la CNN se alimenta en un módulo de recidiva o de captación de atención.
CNN‐LSTM y CNN‐Transformer
Uno de los marcos híbridos más exitosos es el CNN‐LSTM. Por ejemplo, en el conjunto de datos de la competencia IV de BCI público (2a), una CNN con convoluciones separables a fondo seguidas por un Bi-LSTM logró un valor de kappa por encima de 0.70, conformando significativamente una línea de referencia CNN-only.
Enfoques de conjunto y multiescala
Los modelos híbridos también pueden incorporar procesamiento multiescala. Por ejemplo, un modelo podría procesar la señal en tres resoluciones temporales (por ejemplo, usando el desampling por factores de 2 y 4) y combinar las características a través de la atención. Esto imita la forma en que el cerebro mismo procesa la información en múltiples escalas de tiempo, desde el rápido arañazoteo a ritmos corticales lentos.
Futuros Direcciones y desafíos abiertos
A pesar del impresionante progreso, quedan varios desafíos antes de que la decodificación de señales cerebrales se vuelva clínica y comercialmente viable.
Aprendizaje y generalización de transferencias
Un importante cuello de botella es la mala generalización entre temas, sesiones y dispositivos. La mayoría de los modelos de aprendizaje profundo se entrenan y evalúan sobre datos de un solo sujeto (o pequeño cohorte) y fallan cuando se aplican a un nuevo usuario. Los métodos de aprendizaje de transferencia tienen como objetivo adaptar un modelo pre-entrenado a un nuevo tema con un ajuste mínimo.
Aprendizaje no supervisado y autosupervisado
Los datos de señal cerebral etiquetados son costosos y consumen mucho tiempo para adquirir. Métodos no supervisados y autosupervisados aprenden representaciones significativas de señales no etiquetadas, que pueden ser transferidas a tareas de corriente inferior con menos etiquetas.Aprendizaje contrario, codificación predictiva y autoencoding enmascarado se han aplicado a EEG y MEG. Por ejemplo, la
Decodificación en tiempo real y de baja potencia
Para muchas aplicaciones de BCI, como el control de cursor o las extremidades neuroprostéticas, la decodificación debe ocurrir en tiempo real con una latencia mínima. Los modelos de transformadores grandes pueden ser altamente exigentes. Los investigadores están explorando arquitecturas eficientes, incluyendo redes neuronales despifragables que imitan neuronas biológicas y operan en datos basados en eventos, y [FLT disimpresión]
Explicabilidad y confianza
Los médicos y usuarios finales necesitan confiar en un sistema de decodificación, especialmente cuando influye en las decisiones médicas. Los modelos de aprendizaje profundo se llaman a menudo cajas negras, pero el trabajo reciente en la inteligencia artificial (XAI) explicable para las señales cerebrales ha producido mapas de saliencia, propagación de relevancia en capas (LRP), y visualizaciones de atención que resaltan en qué puntos de tiempo o electrodos se centra el modelo.
Multi‐Task y multi-Subjeto Modelado
Los modelos actuales suelen ser entrenados para una sola tarea (por ejemplo, imagen motora o detección de convulsiones). El aprendizaje multitarea, donde una representación compartida se entrena en varias tareas relacionadas simultáneamente, ha demostrado la promesa de mejorar el desempeño de tareas individuales. De manera similar, modelos multisubjeto que aprenden una representación anatómica y funcional común en todos los sujetos podrían permitir la transferencia de cero instantánea: decodificar un tema nuevo sin ningún tipo de calibración.
Conclusión
Las arquitecturas de red neuronales para la decodificación de señales cerebrales han evolucionado desde redes simples totalmente conectadas a híbridos sofisticados de diseños convolutivos, recurrentes y basados en la atención. Las CNNs se destacan en la captura de patrones espaciales; RNNs y LSTMs modelos de dependencias temporales; los transformadores proporcionan un contexto global poderoso y soportan la fusión multimodal.