Research Article

SET Net: Uma Estrutura Híbrida de Aprendizado Profundo para Classificação de Relaxamento da Atenção Baseada em EEG em Aplicações de Interface Cérebro-Computador

DOI:

10.3791/70700

May 29th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este artigo apresenta a rede transformadora de compressão e excitação (SET-Net), que é uma rede híbrida CNN-Transformer que reconhece estados de atenção e relaxamento usando características de espectrograma para identificar estados de atenção e relaxamento baseados em EEG com 93,7% de precisão e alta generalização, a ser usada em aplicações de Interface Cérebro-Computador (BCI).

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A tecnologia de Interface Cérebro-Computador (BCI) é usada como uma ferramenta para fornecer um canal de comunicação direto entre o cérebro humano e o ambiente externo. Isso tem aplicações em sistemas assistivos e interativos. A aquisição não invasiva da atividade neural por meio da Eletroencefalografia (EEG) é padrão nos sistemas BCI. No entanto, é difícil classificar efetivamente estados cognitivos, incluindo atenção e relaxamento, porque o sinal do EEG é não estacionário e ruidoso. Para superar essas limitações, este estudo propõe uma nova arquitetura híbrida de deep learning, a saber, a rede transformadora de aperto e excitação (SE) (SET-Net). Neste método, os sinais de EEG são pré-processados e divididos em janelas temporais para analisar as representações significativas dos espectrogramas. O modelo proposto alcança uma precisão de classificação de 93,7%, com escore F1 de 0,93 e ROC-AUC de 0,98. Isso demonstra a eficácia do modelo híbrido de aprendizado profundo com discriminação aprimorada do estado de atenção-relaxamento baseado em EEG. Isso oferece um sistema escalável para aplicações de BCI em tempo real como tecnologia assistiva na interação humano-computador.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Interfaces Cérebro–Computador (BCIs) tornaram-se uma tecnologia disruptiva que permite que o cérebro humano e dispositivos externos se comuniquem diretamente sem usar conexões neuromusculares tradicionais. A eletroencefalografia (EEG) é a técnica mais comum e amplamente utilizada devido à natureza não invasiva, portabilidade ecusto-benefício 1. BCIs baseadas em EEG têm sido usadas na saúde, bem como em neuroreabilitação, jogos e tecnologias assistivas para pessoas com deficiências neurológicas, examinando a atividade cerebral2. Uma das aplicações mais significativas é a identificação de estados cognitivos, incluindo atenção e relaxamento, que podem ser usados para criar interfaces adaptativas homem-computador e acessibilidade digital3. Baixa relação sinal-ruído, grande variabilidade entre sujeitos e dinâmicas temporais complicadas entre estados de atenção e relaxamento, que são interpretadas usando EEG; portanto, classificar estados de atenção e relaxamento usando EEG é difícil4. Modelos clássicos de aprendizado de máquina, incluindo a machine de vetores de suporte (SVM) e a floresta aleatória, demonstraram desempenho moderado; no entanto, eles são tipicamente baseados em engenharia de características porque não utilizam totalmente a complexidade espacial–espectral–temporal doEEG 5. Desenvolvimentos recentes em aprendizado profundo, especialmente redes neurais convolucionales (CNN) e transformadores, apresentaram novas oportunidades para extração automatizada de características e forte classificação dos sinaisEEG 6.

Sistemas de BCI baseados em EEG têm sido amplamente estudados por um longo período como ferramenta em monitoramento de estados cognitivos, neuroreabilitação e sistemas interativos. A definição de condição mental é um dos desafios mais cruciais, por exemplo, relaxamento e estados de atenção. Em resposta a isso, cientistas demonstraram uma variedade de soluções, como engenharia padrão de características e modelos avançados de aprendizado profundo. Abordagens clássicas de aprendizado de máquina dependem principalmente de características manualmente engenheiradas no tempo, frequência ou espaço tempo-frequência. Pesquisas sobre algoritmos híbridos de aprendizado profundo como parte do sistema SET-Net de classificação de atenção–relaxamento baseada em EEG foram consideradas uma direção científica importante, pois podem potencialmente aprimorar sistemas de BCI que podem ser usados em ambientes reais7,8. Modelos de aprendizado profundo, incluindo redes neurais convolucionais (CNNs), redes neurais recorrentes (RNNs) e transformadores, alcançaram avanços significativos na decodificação de sinais de EEG na última década9,10. Esses avanços levaram a uma decodificação aprimorada e mais eficiente dos estados cognitivos, que são desejáveis para estados cognitivos em neuroreabilitação e tecnologias assistivas11,12. A crescente popularidade dos sistemas BCI enfatiza a importância aplicada de melhorar a precisão da classificação, e resultados recentes mostraram que a classificação pode ser superior a 85% em imagens motoras e atividades de atenção13,14. No entanto, desafios para alcançar classificações fortes em tempo real em ambientes diversos e barulhentos ainda existem apesar desses desenvolvimentos15,16. O principal problema abordado neste estudo é a precisão e validade externa dos modelos baseados em EEG para classificação atenção–relaxamento, particularmente modelos que consistem em aprendizado profundo híbrido na arquitetura SET-Net17,18, são limitadas. Os métodos existentes geralmente estão associados a questões de variabilidade entre assuntos, baixo ruído de sinal e má exploração das propriedades espaço-temporais19,20,21. Existem métodos voltados para extração de características convolucionales, e outros são voltados para a arquitetura de atenção ou transformador, levando a várias opiniões sobre o melhor design de modelo22,23,24. Além disso, modelos de EEG não são fáceis de treinar e justificar devido à indisponibilidade de grandes conjuntos de dados anotados25,26. Essa falta de conhecimento restringe o uso de BCIs em condições reais, sendo o mais importante ser flexível e preciso 27,28. Isso é teoricamente estabelecido em uma mistura de extração de características espaciais, temporais e baseada em atenção, usando modelos híbridos de aprendizado profundo29,30,31. Essa combinação é observada no framework SET-Net, que é alcançado por meio de camadas convolucionais para extrair características locais e mecanismos de autoatenção para aprender dependências globais32. Essa sinergia aprimora a representação dos sinais de EEG e pode ser aplicada para melhor classificação dos estados de relaxamento e atenção. A teoria é iniciada com base na realidade de que a variabilidade dos sinais e do ruído do EEG pode ser eliminada usando a força das características espaço-temporais multiescala e técnicas de adaptação de domínio33. A revisão sistemática está focada em revisar criticamente o progresso teórico da precisão e aplicação prática dos métodos híbridos de aprendizado profundo da arquitetura SET-Net da classificação de atenção-relaxamento baseada em EEG34. A revisão será utilizada para orientar a criação de um sistema BCI melhor, mais interpretativo e generalizável em futuros experimentos, por meio da síntese dos desenvolvimentos mais recentes e da identificação dos pontos fortes e limitações dos métodos. Essas lacunas ajudarão no desenvolvimento futuro de aplicações práticas do BCI que aprimorarão o usuário e a confiabilidade do sistema. A revisão aplicou uma abordagem ampla de revisão da literatura, onde artigos revisados por pares foram exercidos com base em modelos híbridos de deep learning na classificação atenção–relaxamento por EEG34. Os critérios de inclusão focam em tendências recentes em arquiteturas convolucionais, recorrentes e baseadas em atenção no contexto do SET-Net ou sistemas similares35. Modelos analíticos avaliam desenhos de modelos, algoritmos de seleção de características, precisão da classificação e viabilidade em um contexto do mundo real. Os resultados são organizados para explicar a construção teórica, a prática e oportunidades futuras de pesquisa.

Apesar dos avanços recentes, métodos existentes falham em capturar simultaneamente dependências espaciais, espectrais e temporais de longo alcance em sinais de EEG de canal único, resultando em desempenho subótimo na classificação de atenção-relaxamento. Além disso, os métodos existentes são baseados em características adicionadas manualmente ou consideram apenas algumas características dos sinais EEG; assim, eles não podem ser generalizados entre participantes e condições em tempo real. Assim, há necessidade de uma estrutura unificada que possa modelar suficientemente características multidimensionais do EEG e que seja forte e pesquisada em tempo real.

Para superar essas desvanções, este estudo propõe que um artigo de pesquisa sugere um modelo híbrido de aprendizado profundo, denominado Rede de Transformadores de Espremer e Excitar (SET-Net). Em particular, o módulo CNN aprende padrões espaciais espectrais locais com espectrogramas EEG e supera as limitações da extração artesanal de características. O bloco SE melhora a representação de características ao adaptar a importância por canal e aumentar a robustez ao ruído e à variabilidade. O codificador transformador modela dependências temporais de longo alcance que não se limitam a modelos apenas CNN. Além disso, a análise tempo-frequência pode ser realizada de forma eficaz usando representação baseada em espectrogramas, o que aprimora o aprendizado de características discriminativas. Para garantir desempenho estável, foram adotados treinamentos equilibrados e validação sem vazamentos, o que melhorou a generalização do desempenho entre os sujeitos.

Além disso, a estrutura sugerida é confirmada em uma aplicação em tempo real, na qual os estados cognitivos categorizados são transformados em instruções de controle de sistemas interativos. Isso mostra que o modelo é praticamente aplicável em tecnologias assistivas e acessibilidade digital e poderia potencialmente ser usado na implementação prática da BCI.

A principal conquista deste estudo é o projeto de uma nova arquitetura híbrida SET-Net que incorpora redes neurais convolucionais, atenção de espremer e excitar e codificadores transformadores para melhor modelar sinais de EEG. Além disso, uma representação baseada em espectrograma foi usada para representar com sucesso as propriedades tempo-frequência dos sinais EEG. O framework sugerido permite uma forte classificação dos estados cognitivos de atenção e relaxamento. Além disso, o modelo demonstrou ter aplicabilidade prática em uma aplicação de interface cérebro-computador em tempo real.

Este artigo está organizado em seções nas quais uma revisão de estudos que categorizam as classes de atenção e relaxamento da atividade cerebral aplicadas a sistemas BCI. Este artigo é estruturado para apresentar primeiro as lacunas e desafios de pesquisa associados ao desenvolvimento dos sistemas BCI, e posteriormente apresenta o processo e a metodologia de aquisição de dados que compõem o registro do sinal de EEG, pré-processamento e representação de características. Ele discute a importância das atividades de atenção e relaxamento, bem como o processo de derivar características significativas a partir dos dados do EEG. Os resultados são então apresentados e avaliados usando análises quantitativas e comparativas, bem como o desempenho real da aplicação. A última parte discute as descobertas, limitações do estudo e direções futuras de trabalho.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O estudo foi conduzido de acordo com a Declaração de Helsinque e aprovado pelo Comitê de Ética Institucional da Universidade SR, Warangal, Telangana, Índia (Aprovação nº 007/2026). O consentimento informado foi obtido por escrito de todos os participantes antes da coleta de dados.

Seleção de Participantes

Os dados de EEG foram coletados de 11 participantes saudáveis (faixa etária: 25–45 anos; idade média: 28 anos) sem histórico de transtornos neurológicos ou psiquiátricos. Neste estudo, foram considerados um total de 1175 segmentos de EEG, dos quais 527 pertencem à classe de relaxamento e 648 à classe de atenção. Participantes cujos registros de EEG apresentaram artefatos de movimento excessivos ou baixa qualidade do sinal foram excluídos.

Configuração de Aquisição de EEG

O layout geral do sistema sugerido de interface cérebro-computador baseado em EEG é mostrado na Figura 1, que mostra todo o pipeline de aquisição de sinais, classificação e uso em tempo real. Os dados do EEG foram registrados usando um pequeno módulo de aquisição de biopotencial ligado a um sistema baseado em microcontrolador. Os eletrodos em gel foram colocados com base no sistema Internacional 10–20, ou seja, nos pontos pré-frontais Fp1 e Fp2, com eletrodos de referência e terra posicionados nos lóbulos da audição, conforme indicado na Figura 2. Os sinais eram digitalizados a uma taxa de 128 Hz e enviados para um computador usando um script de aquisição em Python autoescrito. Um pré-tratamento adequado da pele e gel condutor foram usados para reduzir a impedância do eletrodo e melhorar a qualidade do sinal.

Procedimento experimental

As gravações de EEG foram realizadas sob duas condições cognitivas, relaxamento e atenção, seguindo um protocolo padronizado. Na condição de relaxamento, o participante era sentado em um ambiente confortável e de baixo ruído e instruído a permanecer imóvel com movimentos mínimos. Áudio instrumental calmante era reproduzido por fones de ouvido, e a aquisição do EEG era iniciada usando o comando python collect.py. Os sinais de EEG eram registrados por 5 minutos por sessão e repetidos por quatro sessões. Na condição de atenção, o participante foi instruído a realizar tarefas que demandam atenção, como jogos interativos, mantendo a mesma configuração de aquisição da condição de relaxamento. Os sinais de EEG eram registrados por 5 minutos por sessão e repetidos por quatro sessões. Cada participante participou por um total de 40 minutos, consistindo em 20 minutos de relaxamento e 20 minutos de atenção, permitindo uma comparação confiável dos estados cognitivos.

O conjunto de dados processado foi organizado em segmentos rotulados da seguinte forma: Relaxamento (0); Atenção (1). Cada segmento tinha uma duração de 4 s com 50% de sobreposição e era representado como um espectrograma usando uma transformada de Fourier de curto prazo.

Processamento de Sinal, Representação de Características e Implementação de Modelos

Os sinais de EEG obtidos foram pré-processados para eliminar ruído e artefatos. Um filtro de entalhe de 50 Hz foi usado para remover interferência na linha de energia, e um filtro passa-banda Butterworth de 4ª ordem no sinal entre 0,5 e 30 Hz foi usado para selecionar as faixas de frequência EEG relevantes. O limiar de amplitude e a inspeção visual foram usados para identificar segmentos contaminados por artefatos, e aproximadamente 8–12% dos dados foram excluídos. Adição de ruído gaussiano, mascaramento temporal e mascaramento de frequência são métodos de aumento de dados usados para melhorar a robustez do modelo. Os sinais de EEG foram filtrados e depois divididos em janelas de 4 segundos separadas por 50 por cento.

Os segmentos individuais de EEG foram convertidos para uma representação tempo-frequência (Transformada de Fourier de Curto Tempo), conforme mostrado na Equação (1), para permitir a extração de características temporais e espectrais.

figure-protocol-1(1)

Os espectrogramas resultantes foram normalizados e redimensionados para dimensões fixas para servir como entradas ao modelo de classificação. Para evitar vazamentos de dados induzidos por sobreposição, o conjunto de dados foi dividido em subconjuntos de treinamento (70%), validação (10%) e testes (20%) antes da segmentação, conforme ilustrado na Figura 3. Além disso, foi realizada a validação cruzada com um sujeito fora (LOSO) para avaliar a generalização entre sujeitos, onde dados de um sujeito foram usados para testes, enquanto os dados restantes foram usados para treinamento.

A arquitetura proposta SET-Net, conforme mostrado na Figura 4, foi projetada para capturar características multidimensionais do EEG. O modelo integra uma espinha dorsal de rede neural convolucional (CNN) para extrair representações espaciais e espectrais, seguida por um bloco de compressão e excitação (SE) que recalibra adaptativamente a importância das características por canal, conforme descrito na Equação (2). A espinha dorsal CNN consiste em duas camadas convolucionais com tamanho de kernel de 3 × 3, seguidas pela normalização em lote e ativação exponencial linear unitária (ELU)

figure-protocol-2(2)

A estrutura interna do bloco SE é mostrada na Figura 5. Para capturar dependências temporais de longo alcance, foi incorporado um codificador transformador, cujo mecanismo de atenção está definido na Equação (3) e ilustrado na Figura 6.

figure-protocol-3(3)

Uma camada de pooling médio adaptativo foi usada para reduzir os mapas de características a um tamanho fixo de 16 × 16. A razão de redução do bloco SE é 8, que é usada para recalibrar as respostas de características por canal. O codificador do transformador consistia em quatro camadas com quatro cabeças de atenção, um tamanho de dimensão feed-forward de 256 e um tamanho de embedding do modelo de 128.

A classificação final foi realizada usando camadas totalmente conectadas com regularização de dropout e uma função softmax de ativação para distinguir entre os estados de atenção e relaxamento. A arquitetura detalhada por camadas do modelo proposto é apresentada na Tabela 1.

O modelo foi treinado usando o otimizador AdamW com taxa inicial de aprendizado de 0,001 e decaimento de peso de 1×10⁻4. Um agendador de recozimento cosseno foi usado para melhorar a convergência, e 50 épocas foram treinadas usando um tamanho de lote de 32. O desequilíbrio de classe foi superado usando uma função de perda ponderada por entropia cruzada, conforme descrito na Equação (4).

figure-protocol-4(4)

A Tabela 2 resume a configuração de treinamento, e a Tabela 3 apresenta a busca por hiperparâmetros da proposta SET-Net, que foi usada na classificação de atenção-relaxamento baseada em EEG. Os parâmetros selecionados proporcionam estabilidade do treinamento, ampliação da generalização e tolerância a mudanças nos sinais de EEG. Os parâmetros escolhidos proporcionam estabilidade ao processo de treinamento, aprimoram a generalização e resistem a alterações do sinal do EEG. Precisão, precisão, recordação, F1-score e ROC-AUC foram usados para medir o desempenho do modelo. Todos os pipelines envolvendo pré-processamento, treinamento de modelos e avaliação foram escritos em Python usando o framework PyTorch para garantir reprodutibilidade. A Tabela 4 fornece uma descrição detalhada da solução de problemas para orientar e resolver problemas associados à aquisição de EEG, pré-processamento, treinamento de modelos e uso em tempo real. A Tabela 5 oferece uma visão geral dos materiais do dispositivo EEG para permitir uma estrutura fácil para conduzir experimentos e o montar experimental. Python 3.8 com o framework de deep learning PyTorch foi usado para implementar o framework proposto SET-Net. Bibliotecas padrão de computação científica eram usadas para pré-processamento de sinais e extração de recursos usando NumPy, SciPy e Matplotlib. Todo procedimento experimental era realizado em um sistema com processador Intel i7 e 16 GB de RAM para acelerar o treinamento dos modelos.

DISPONIBILIDADE DE DADOS:

O conjunto de dados anonimizado de EEG gerado e analisado durante este estudo está disponível publicamente no repositório Zenodo sob o seguinte link de acesso: https://zenodo.org/records/19627795.

Todos os dados foram desidentificados para garantir a confidencialidade dos participantes, de acordo com as diretrizes éticas institucionais aprovadas pelo Comitê de Ética Institucional da SR University (Aprovação nº 007/2026).

As informações processadas, configurações do modelo e especificidades de implementação necessárias para recriar os resultados são apresentadas no manuscrito, e o código-fonte está disponível publicamente em: https://github.com/Ravichanderj/SET-Net-EEG-BCI.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Representação de Características Baseada em Espectrograma

O principal objetivo deste estudo foi classificar corretamente os estados de atenção e relaxamento com a ajuda dos sinais de EEG. A conversão de sinais brutos de EEG em espectrogramas tornou possível extrair características discriminativas de forma eficaz. Os espectrogramas indicam um aumento da atividade na banda alfa (8–13 Hz) durante o relaxamento e um aumento da atividade beta (14–2...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A pesquisa atual sugere um modelo híbrido de aprendizado profundo, SET-Net, para classificação de atenção-relaxamento baseada em EEG. Para aprender as características espaciais, espectrais e temporais dos sinais EEG, a arquitetura combina redes neurais convolucionais, atenção de compressão e excitação e codificadores transformadores, como mostrado na Figura 5. Os resultados indicam que o método proposto pode atingir o objetivo do estudo. A precisão, o escore...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não possuem interesses financeiros concorrentes conhecidos ou relacionamentos pessoais que possam influenciar o trabalho relatado neste estudo.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem à SR University, Warangal, Estado de Telangana, Índia, por fornecer a instalação laboratorial necessária e a aprovação ética para conduzir este estudo.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Computador / LaptopGenéricoQualquer sistema padrão≥ 8GB de RAM recomendados
Script de aquisição de dadosCostumecollect.pyScript de aquisição baseado em Python
Eletrodos descartáveis em gelGenéricoEletrodos Ag/AgCl pré-gelificadosAdesivo descartável
Módulo de aquisição de EEGLaboratórios InvertidosBioAmp EXG PillInterface analógica para sinais biopotenciais
Gel de eletrodos (se usados eletrodos reutilizáveis)GenéricoGel condutorMelhora a condutividade do sinal
Aplicação interativa (jogo)GenéricoQualquer jogo simples (por exemplo, corrida)Interface controlada por teclado
Fios de pontaGenéricoMasculino– Conectores fêmeaFios padrão de placas de proveição
Matplotlib / SeabornCódigo abertoVersões mais recentesBibliotecas de visualização
Placa microcontroladorArduinoUno / Maker UnoADC de 10 bits, interface USB
Ambiente de programação em PythonFundação de Software PythonPython ≥ 3.8Linguagem de programação open-source
Biblioteca PyTorchMeta IAVersão ≥ 1.12Estrutura de aprendizado profundo
Scikit-learnCódigo abertoVersão estável mais recenteUtilidades de ML
Bibliotecas de processamento de sinaisSciPyVersão mais recenteFiltragem, STFT
Cabo USBGenéricoUSB Tipo-A para BCabo de transferência de dados

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Brain Computer InterfaceEEG ClassificationAttention RelaxationDeep LearningHybrid Neural NetworkSET NetSqueeze Excitation NetworkTransformer NetworkSpectrogram AnalysisHuman Computer Interaction
Video Coming Soon

Related Articles