Introdução

A decodificação de sinais cerebrais de gravações não invasivas ou invasivas é uma das fronteiras mais ambiciosas da neurociência computacional moderna. A eletroencefalografia (EEG), a magnetoencefalografia (MEG), a ressonância magnética funcional (fMRI) e a eletrocorticografia (ECoG) produzem fluxos de dados de alta dimensão, ruidosos e não estacionários. A definição do código neural a partir desses sinais tem o potencial de revolucionar diagnósticos clínicos, interfaces cérebro-computador (ICCs) e neurorreabilitação. Ao longo da última década, a aprendizagem profunda – e, em particular, novas arquiteturas de rede neural – melhorou drasticamente a precisão, robustezidade e generalização dos sistemas de de decodificação de sinais cerebrais. Este artigo examina os avanços arquitetônicos fundamentais, desde os primeiros perceptores de camadas até os transformadores modernos, e examina como cada paradigma aborda os desafios únicos dos dados neurais.

Os sinais cerebrais caracterizam-se por baixas relações sinal-ruído, elevada variabilidade inter-sujeito e dinâmicas espaciais complexas. Os oleodutos tradicionais de aprendizado de máquina requerem extensa extração de características artesanais, tais como densidades espectrais de potência ou padrões espaciais comuns. Modelos de aprendizagem profunda, por contraste, podem aprender hierarquias de características relevantes diretamente de gravações brutas ou minimamente pré-processadas. Essa mudança permitiu o estado da arte na detecção de convulsões, classificação de imagens motoras, estadiamento do sono e até mesmo a decodificação de fala imaginada. As seguintes seções detalham a evolução das arquiteturas de rede que tornaram esses avanços possíveis.

Abordagens tradicionais da rede neural

As primeiras tentativas de aplicar redes neurais a sinais cerebrais basearam-se em perceptrons multicamadas] (MLPs). Estas redes de feedforward totalmente conectadas tomam um vetor de recursos – tipicamente projetado a partir do sinal bruto – e aprendem um mapeamento não-linear para uma saída desejada. Para as BCIs baseadas em EEG, as características comuns incluíam estimativas de banda-poder de múltiplas bandas de frequência (delta, theta, alfa, beta, gama) e filtros espaciais derivados de algoritmos comuns de padrão espacial (CSP). Enquanto as MLPs poderiam superar classificadores lineares como LDA ou SVM em determinadas tarefas, elas sofriam de várias limitações fundamentais quando aplicadas a dados neurais.

Primeiro, os LPMs tratam as características de entrada como independentes, ignorando a topologia espacial dos eletrodos e a ordenação temporal das amostras. Segundo, o número de parâmetros cresce rapidamente com a dimensionalidade de entrada, levando a um alto risco de sobreposição nos conjuntos de dados relativamente pequenos típicos de experiências com BCI (muitas vezes menos de mil tentativas por indivíduo). Terceiro, os LPMs são sensíveis ao ruído e apresentam capacidade limitada para modelar a alta variação, dinâmica não estacionária dos sinais cerebrais. Como consequência, embora os LMPs tenham fornecido uma prova de conceito para decodificação de ponta a ponta, sua utilidade prática foi circunscrita. Os pesquisadores logo se voltaram para arquiteturas que poderiam explorar a estrutura inerente das gravações neurais.

Limitações de redes totalmente conectadas

Além das questões acima, camadas totalmente conectadas ignoram a localização da informação. Numa montagem EEG, eletrodos adjacentes frequentemente registram atividade correlacionada de fontes corticais próximas. Uma camada convolucional que respeita esta conectividade local pode alavancar essa estrutura espacial de forma muito mais eficiente. Da mesma forma, a sucessão temporal de amostras contém informações críticas sobre potenciais relacionados a eventos (ERPs) e dinâmica de fases oscilatórias, que um MLP padrão não pode capturar sem engenharia de características explícitas de séries temporais.

Redes Neurais Convolucionais (CNNs) para Extração de Característica Espacial

As redes neurais convolucionais tornaram-se uma pedra angular da decodificação de sinais cerebrais, especialmente para os dados EEG e ECOG. As CNNs aplicam filtros apreensíveis através das dimensões espaciais ou espaço-temporais da entrada, preservando as relações locais, reduzindo drasticamente o número de parâmetros em comparação com uma rede totalmente conectada. Duas famílias principais de arquiteturas CNN surgiram: aquelas que usam convoluções 1D ao longo do tempo (convoluções temporais) e aquelas que usam convoluções 2D sobre canais de eletrodos dispostos em uma grade 2D (convoluções espaciais). Muitos modelos bem sucedidos combinam ambas.

EEGNet e Shallow/Deep ConvNets

Uma das arquiteturas mais influentes é EEGNet, uma CNN compacta projetada especificamente para classificação EEG. A EEGNet usa convoluções profundas e separáveis para aprender filtros espaciais específicos de sujeitos, mantendo o modelo suficientemente leve para treinar em pequenos conjuntos de dados. A arquitetura consiste em uma convolução temporal (para aprender filtros de frequência), seguida de uma convolução profunda entre canais (para aprender padrões espaciais), e então uma convolução separable para combinar mapas de características. Foi demonstrado que a EEGNet consegue desempenho competitivo em vários paradigmas BCI (imagens motoras, P300, negatividade relacionada com erros) com apenas alguns milhares de parâmetros. O papel EEGNet original [ fornece benchmarks detalhados.

Outras variantes CNN amplamente utilizadas incluem Shallow ConvNet e Deep ConvNet, proposta por Schirrmeister et al. (2017). A variante rasa processa EEG bruto com uma única convolução temporal, um agrupamento espacial entre canais e uma camada densa final. É eficaz para tarefas de imagens motoras onde as mudanças de potência de banda de frequência são proeminentes. A variante profunda empilha múltiplos blocos convolucionais com normalização em lote, atingindo maior precisão em tarefas de discriminação mais complexas, mas requerendo mais dados para treinar. Estes modelos tornaram-se linhas de base em muitos estudos BCI.

CNNs para detecção de convulsões e além

Em aplicações clínicas, as CNNs demonstraram desempenho notável na detecção automatizada de crises a partir de gravações contínuas de EEG. Ao tratar o sinal multicanal como uma imagem 2D (canais × tempo), uma CNN pode aprender a reconhecer as assinaturas espaço-temporais da atividade ictal e interictal. Estudos em larga escala, como aqueles que usam o Sistema de Dados EEG do Hospital Universitário Temple, mostraram que detectores baseados em CNN podem atingir sensibilidade e especificidade superiores a 90%, enquanto operam em tempo real. Da mesma forma, as CNNs têm sido aplicadas para detectar sono de ondas lentas, prever resposta medicamentosa e identificar biomarcadores para transtornos como esquizofrenia e doença de Alzheimer.

Redes Neural Recorrentes (RNNs) e LSTM para Dinâmica Temporal

Os sinais cerebrais são intrinsecamente sequenciais: o estado do cérebro no momento t] é fortemente influenciado pela sua história recente. As redes neurais recorrentes (RNNs) são concebidas para processar sequências mantendo um estado oculto que é actualizado a cada passo. Os RNNs iniciais lutaram com o problema de gradiente de desaparecimento , o que os impediu de aprender dependências de longo alcance – exatamente o tipo de estrutura presente em potenciais relacionados com eventos, oscilações lentas e actividade de planeamento motor. A introdução de Memória Longa de Curto Prazo[] (LSTM) e mais tarde ] Unidades de Recorrente Gated[ (GRUs] (GRUs) abordou esta questão incorporando mecanismos de gating que controlam o fluxo de informação.

LSTMs para classificação contínua de EEG

Os LSTMs têm sido empregados para tarefas onde o contexto temporal é primordial, como a classificação da carga cognitiva, estágios de sono ou fala imaginada a partir de microestados EEG. Por exemplo, no estadiamento do sono, um segmento de dados de polissonografia de 8 segundos pode conter padrões característicos que evoluem ao longo dos minutos; um LSTM pode codificar essas dependências de maior alcance. Os LSTMs bidirecionais (Bi-LSTMs) melhoram ainda mais o desempenho processando o sinal tanto para frente quanto para trás no tempo, captando efetivamente características simétricas em torno de um evento.

Um dos desafios de usar LSTMs para sinais cerebrais é a alta taxa de amostragem (frequentemente 250 Hz ou superior), que resulta em sequências de entrada muito longas. Para atenuar isso, muitas arquiteturas primeiro downsample o sinal bruto ou aplicar uma interface convolucional para reduzir a resolução temporal antes de alimentar as características para as camadas recorrentes. A combinação de CNN e LSTM – uma convLSTM[ – tem sido especialmente eficaz para tarefas como imagens motoras, onde a CNN extrai padrões espaciais de cada janela de curto tempo e a LSTM rastreia a sua evolução ao longo de vários segundos. Uma revisão abrangente da decodificação EEG baseada em LSTM pode ser encontrada em este inquérito de 2021 em Reconhecimento de Padrão.

GRU e RNNs de Atenção Aumentados

As GRUs oferecem um mecanismo de fixação mais simples do que as LSTMs, com menos parâmetros, e têm mostrado desempenho comparável em muitos conjuntos de dados EEG. Os pesquisadores também aumentaram as RNNs com atenção, permitindo que a rede se concentre nos passos mais informativos do tempo. Por exemplo, em uma tarefa de go-/no-go, o modelo pode aprender a atender ao momento de apresentação de estímulos em vez da linha de base que o precede. Mecanismos de atenção dentro dos quadros RNN muitas vezes servem como um passo para as arquiteturas de transformadores totalmente baseadas em atenção descritas a seguir.

Transformadores e Mecanismos de Atenção

A arquitetura do transformador, originalmente desenvolvida para processamento de linguagem natural, foi adaptada para decodificação de sinais cerebrais com resultados impressionantes. No seu núcleo, o transformador substitui a recorrência por um mecanismo de auto-atenção ] que calcula somas ponderadas de todas as posições de entrada, permitindo que o modelo capture diretamente dependências de longo alcance sem o gargalo sequencial de RNNs. Para os sinais EEG e MEG, os transformadores podem atender tanto às relações espaciais (canais cruzados) quanto temporais (pontos de tempo cruzados), tornando-os altamente expressivos.

EEG-Transformer e Variantes

Uma das primeiras adaptações é o EEG-Transformer, que tomba a série de tempo multicanal em patches (por exemplo, janelas de 1 segundo) e, em seguida, aplica um transformador padrão de encoder-somente com incorporações posicionais. Esta arquitetura alcançou resultados de última geração em imagens motoras e parâmetros de reconhecimento de emoções. Para reduzir a complexidade computacional, muitos trabalhos aplicam uma interface convolucional para reduzir o comprimento da sequência antes das camadas de transformador. O EEG-Transformer paper fornece uma descrição completa do desenho.

Outra variante notável é o Transformador de Visão (ViT)] adaptado para EEG, tratando a imagem 2D EEG (canais × tempo) como uma grade de patch. A abordagem ViT foi usada para detecção de crises de indivíduos cruzados e classificação de estágios de sono. Modelos mais recentes, como SPEECH-TCNet[ e EEG-Conformer[, combinam módulos convolucionais com cabeças de transformador para equilibrar extração local e global de recursos.

Transformadores multi-modal e Inter-Atenção

A decodificação de sinais cerebrais geralmente beneficia com a fusão de múltiplas modalidades, como EEG e fMRI, ou EEG e rastreamento de olhos. Os transformadores suportam naturalmente entradas multimodais usando codificadores separados para cada modalidade e, em seguida, interligando-se entre eles. Por exemplo, um estudo recente sobre reconhecimento de emoções usou um transformador para fundir sinais EEG e sinais fisiológicos periféricos (ECG, GSR) através de atenção cruzada, atingindo uma precisão significativamente maior do que as linhas de base de uma única modalidade. Este paradigma é promissor para a construção de ICB robustos que funcionam em ambientes reais e barulhentos.

Arquiteturas híbridas: Combinando CNNs, RNNs e Transformers

Nenhuma arquitetura domina todas as tarefas de decodificação de sinais cerebrais. Os modelos contemporâneos mais eficazes são frequentemente híbridos que exploram as forças de cada bloco de construção. Um pipeline híbrido típico aplica primeiramente um conjunto de camadas convolucionais para extrair características espaciais locais (por exemplo, de montagens de eletrodos) e padrões temporais de curto prazo (por exemplo, bandas de frequência). A saída da CNN é então alimentada em um módulo recorrente ou baseado em atenção que captura dependências de maior alcance. Finalmente, uma camada global ou densa produz a classificação ou saída de regressão.

CNN-LSTM e CNN-Transformer

Um dos quadros híbridos mais bem sucedidos é o CNN-LSTM. Por exemplo, no conjunto de dados público BCI Competition IV (2a), uma CNN com convoluções separáveis de profundidade seguidas de um Bi-LSTM alcançou um valor kappa acima de 0,70, superando significativamente uma linha de base apenas CNN. Da mesma forma, o CNN-Transformer[] (às vezes chamado Conformer) foi aplicado ao EEG bruto para decodificação de fala. A interface convolucional reduz o comprimento da sequência e enriquece as características locais, enquanto o transformador captura o contexto global. Este design é particularmente eficaz para matrizes EEG de alta densidade (128 canais ou mais).

Abordagens de Conjunto e Multi-Escala

Modelos híbridos também podem incorporar processamento multi-escala. Por exemplo, um modelo pode processar o sinal em três resoluções temporais (por exemplo, usando a minimização por fatores de 2 e 4) e combinar as características através da atenção. Isto imita a forma como o próprio cérebro processa informações em várias escalas de tempo, desde o rápido spiking até ritmos corticais lentos. Conjuntos de arquiteturas diversas também foram usados em competições de BCI, embora eles venham ao custo de um aumento do tempo de inferência – um fator muitas vezes crítico para sistemas em tempo real.

Instruções futuras e desafios abertos

Apesar do progresso impressionante, vários desafios permanecem antes que a decodificação de sinais cerebrais em rede neural se torne clinicamente e comercialmente viável.

Transferência de Aprendizagem e Generalização

Um dos principais pontos de estrangulamento é a fraca generalização entre os temas, as sessões e os dispositivos.A maioria dos modelos de aprendizagem profunda são treinados e avaliados em dados de um único sujeito (ou uma pequena coorte) e falham quando aplicados a um novo usuário. Os métodos de aprendizagem de transferência visam adaptar um modelo pré-treinado a um novo sujeito com ajuste mínimo de precisão.Os métodos incluem a adaptação de domínio (por exemplo, alinhando distribuições de recursos através de treinamentos alternativos ou discrepância média máxima) e ajuste de parâmetros eficientes de modelos de fundação grandes.Grandes conjuntos de dados públicos, como o TUH EEG e o MNE-Scan, estão a permitir a pré-formação de codificadores EEG de uso geral, análogos ao BERT ou ao GPT para texto. A proposta "EEG-BERT"] é um exemplo precoce desta tendência.

Aprendizagem sem Perspectiva e Auto-Supervisionada

Os dados de sinal cerebral etiquetados são caros e demorados para adquirir. Métodos não perspicazes e auto-supervisados aprendem representações significativas de sinais não marcados, que podem então ser transferidos para tarefas a jusante com menos rótulos. A aprendizagem contrastiva, codificação preditiva e auto-codificação mascarada foram todos aplicados ao EEG e MEG. Por exemplo, o SimCLR-EEG[] framework aprende invariâncias a mudanças de ruído e eletrodos, permitindo características robustas para classificação de estágios de sono com menos de 10% dos dados originais rotulados. Esta direção é crucial para ampliar a aplicabilidade de redes neurais profundas em ambientes clínicos reais.

Decodificação em tempo real e de baixa latência

Para muitas aplicações de BCI, como o controle de cursores ou membros neuroprotéticos, a decodificação deve acontecer em tempo real com latência mínima. Modelos de grandes transformadores podem ser computacionalmente exigentes. Pesquisadores estão explorando arquiteturas eficientes, incluindo ] redes neurais de perfuração que mimetizam neurônios biológicos e operam em dados baseados em eventos, e ] destilação de conhecimento[ para comprimir grandes modelos em versões leves adequadas para hardware móvel ou incorporado. Além disso, chips neuromórficos (por exemplo, Intel Loihi, Brainchip Akida) prometem executar a decodificação de sinais cerebrais com potência extremamente baixa, tornando possíveis BCIs wearable.

Explicabilidade e Confiança

Os clínicos e os utilizadores finais precisam confiar num sistema de decodificação, especialmente quando influencia as decisões médicas. Modelos de aprendizagem profunda são frequentemente chamados caixas pretas, mas o trabalho recente em IA explicavel (XAI) para sinais cerebrais produziu mapas de saliência, propagação de relevância em camadas (LRP) e visualizações de atenção que destacam em que pontos de tempo ou eletrodos o modelo está focado. Tais explicações não só constroem confiança, mas também podem revelar características fisiologicamente relevantes – por exemplo, que um detector está focado em uma banda de frequência específica ou em uma região cerebral específica. A avaliação padronizada dos métodos de explanabilidade para decodificação neural é uma área de pesquisa ativa.

Modelação multitarefa e multisujeitos

Os modelos atuais são geralmente treinados para uma única tarefa (por exemplo, imagética motora ou detecção de crises).A aprendizagem multitarefa, onde uma representação compartilhada é treinada em várias tarefas relacionadas simultaneamente, tem mostrado promessa para melhorar o desempenho individual da tarefa. Da mesma forma, modelos multi-sujeitos que aprendem uma representação anatômica e funcional comum entre os sujeitos poderia permitir a transferência zero-shot: decodificar um novo sujeito sem qualquer dado de calibração.Esta seria uma mudança de paradigma para as ICBs, eliminando as sessões de calibração tediosas atualmente necessárias.

Conclusão

As arquiteturas de rede neural para decodificação de sinais cerebrais evoluíram de redes simples e totalmente conectadas para sofisticados híbridos de projetos convolucionais, recorrentes e baseados em atenção. As CNNs se destacam na captura de padrões espaciais; as dependências temporais do modelo RNNs e LSTMs; os transformadores fornecem contexto global poderoso e suportam fusão multimodal. Os modelos modernos mais eficazes combinam esses elementos, muitas vezes com transferência e aprendizagem auto-supervisionada para superar a escassez de dados. Desafios como generalização, desempenho em tempo real e interpretabilidade permanecem, mas o ritmo da inovação está acelerando. À medida que maiores conjuntos de dados rotulados e recursos computacionais se tornam disponíveis, podemos esperar que os decodificadores de rede neural se tornem uma ferramenta padrão na pesquisa de neurociência e um componente chave das interfaces de computador-cérebro da próxima geração. O objetivo final – um decodificador robusto, em tempo real e independente – está ao alcance.