Artículo de investigación

Marco de trabajo de atención basado en GNN y aprendizaje profundo para el modelado de canales de campo cercano y el conformado de haces en sistemas inalámbricos de sexta generación: un estudio de simulación

3 vistas

DOI:

10.3791/72011

1 de septiembre de 2026

En este artículo

Resumen

Este trabajo presenta un marco de aprendizaje profundo basado en la física para la formación de haces y la modelización de canales en campo cercano en sistemas inalámbricos de sexta generación que utilizan metasuperficies inteligentes extremadamente grandes. En comparación con las técnicas tradicionales de comunicación en campo lejano, el método propuesto mejora la eficiencia energética, la ganancia en la formación de haces y la eficiencia espectral.

Resumen

La aparición de redes de sexta generación (6G) ha impulsado el desarrollo de metasuperficies inteligentes extremadamente grandes (XL-IMS) para ofrecer velocidades ultraelevadas y alta eficiencia espectral. Sin embargo, los canales clásicos de campo lejano no son aplicables a la transmisión en campo cercano debido a la propagación de ondas esféricas y a la falta de estacionariedad espacial, lo que provoca una reducción en el rendimiento del formado de haces y un aumento en la complejidad computacional. Por lo tanto, el objetivo de esta investigación es desarrollar un método para la modelización del canal en campo cercano y la optimización del formado de haces basado en aprendizaje profundo guiado por la física. La solución propuesta utiliza un modelo de canal de onda esférica guiado por principios físicos, junto con redes neuronales en grafos (GNN) y mecanismos de atención, para capturar las relaciones espaciales locales entre los usuarios y la red global. Además, se propone un algoritmo de formado de haces basado en aprendizaje para aumentar la eficiencia en la concentración de energía sobre los usuarios en campo cercano. El rendimiento del marco propuesto se evalúa utilizando escenarios de propagación realistas del conjunto de datos DeepMIMO. Los resultados de simulación muestran que la técnica propuesta alcanza una tasa de 11,6 bps/Hz, una ganancia de formado de haces de 28 dB, una eficiencia espectral de 10,5 bps/Hz, una eficiencia energética de 9,8 bits/julio y una relación señal a interferencia más ruido (SINR) de 25 dB. En comparación con técnicas tradicionales como Forzado de Cero (ZF), Error Cuadrático Medio Mínimo (MMSE), Relajación Semidefinida (SDR) y Optimización Alternante (AO), el esquema propuesto mejora el rendimiento general de la comunicación en aproximadamente un 10-15 %. Estos resultados revelan que la integración de la modelización del canal en campo cercano con el aprendizaje basado en atención mediante GNN puede servir como una técnica eficiente y precisa de formado de haces para futuras redes inalámbricas 6G que utilicen la tecnología XL-IMS.

Introducción

El interés en la formación de haces ha crecido considerablemente en los últimos años. Con la introducción del 6G, se han vuelto comunes requisitos extremos de capacidad, impulsados por la creciente demanda de una mejor conectividad y tasas de datos más rápidas. Por lo tanto, la formación de haces es un método prometedor para guiar eficazmente las señales y mejorar el rendimiento general de la red1. Los sistemas convencionales de comunicación inalámbrica han aprovechado eficazmente los recursos espaciales de campo lejano para lograr diversidad espacial. Un área emergente de estudio con una enorme promesa para las futuras comunicaciones inalámbricas es la formación de haces de campo cercano2.

Las superficies inteligentes reconfigurables (RIS), por otro lado, son particularmente interesantes porque pueden superar algunos de los problemas de propagación asociados con el espectro mmWave/THz3,4. Las RIS pueden reflejar, refractar y manipular ondas electromagnéticas entrantes5. En este caso, el objetivo principal es dirigir el haz en una dirección o forma deseada, y la RIS puede representarse como un elemento que altera los patrones de radiación de la fuente radiante. Para las RIS en campo lejano, a lo largo de los años se han estudiado varios temas fundamentales6,7,8,9,10,11, incluyendo la estimación del canal, la localización, la normalización y la formación de haces pasiva/activa. Esta tecnología posibilita la comunicación multiusuario mediante el enfoque de haces, lo cual ofrece un equilibrio entre la pérdida de trayectoria y la penetración, especialmente en bandas de frecuencia media como el rango de 10 GHz12. Las interfaces inteligentes se han desarrollado aún más dentro de las redes de comunicación y actualmente se estudian para mejorar la resolución espacial y el ancho de banda de comunicación13. Las frecuencias más altas y las aberturas de antena más grandes durante la transición del 5G al 6G convierten los escenarios tradicionales de comunicación en campo lejano en escenarios de comunicación en campo cercano14,15.

La región de campo cercano será importante en las redes 6G, lo que exige investigar nuevas técnicas de campo cercano16. Las ondas deben tratarse como ondas esféricas en lugar de ondas planas para mejorar la propagación de las ondas electromagnéticas en la tecnología de campo cercano. Esta nueva característica física exhibe una variedad de efectos electromagnéticos, incluyendo no estacionariedad espacial, división de haces, tri-polarización y ondas evanescentes17. Debido a esto, muchos métodos convencionales de comunicación podrían no aprovechar completamente estas nuevas características físicas o experimentar pérdidas severas de rendimiento en entornos de campo cercano 6G18. Una discrepancia entre las tecnologías actuales de comunicación en campo lejano y los modelos de propagación en campo cercano puede reducir significativamente la eficacia de las técnicas actuales de campo lejano en ubicaciones de campo cercano19. En contraste con los sistemas angostos tradicionales de campo lejano, deben considerarse nuevos efectos electromagnéticos (EM) en los sistemas RIS de banda ancha en campo cercano. En primer lugar, el canal de campo cercano incorpora dos ángulos y dimensiones de distancia debido al frente de onda esférico en el espectro de campo cercano, a diferencia de la hipótesis de onda plana en los modelos de canal de campo lejano. Esto da lugar, en lugar de la navegación de haces en campo lejano, a la acción de concentración del haz en campo cercano20,21. La expresión «efecto de división de haces» hace referencia a la posibilidad de que los haces generados en diferentes instancias se concentren en ubicaciones separadas22.

A diferencia del campo lejano, donde los frentes de onda electromagnéticos (EM) se aproximan como planos, las comunicaciones en el campo cercano requieren considerar la propagación de frentes de onda esféricos. Esta característica introduce tanto oportunidades como desafíos para las redes inalámbricas futuras. Al aprovechar los frentes de onda esféricos, el enfoque de haces puede concentrar las señales dentro de una región espacial específica, permitiendo una mejor supresión de interferencias y una comunicación multiusuario en comparación con la orientación convencional de haces en campo lejano. Sin embargo, también introduce complejidades adicionales en el diseño y el procesamiento de señales23,24. Los estudios iniciales sobre comunicaciones en campo cercano incluyen el trabajo en25, que describió las diferencias entre las regiones de campo cercano y campo lejano, los conceptos clave, los desafíos técnicos, las aplicaciones y la estimación del canal basada en códigos. Posteriormente, el autor26 examinó las diferencias fundamentales entre la transmisión en campo lejano basada en frentes de onda planos y la transmisión en campo cercano basada en frentes de onda esféricos, centrándose en formación de haces, análisis del canal, rendimiento del sistema e integración con tecnologías de próxima generación. Además, el autor27 investigó los principales desafíos en las comunicaciones en campo cercano, incluyendo modelado del canal, estimación, formación de haces, arquitectura de hardware y detección, al tiempo que resumió los avances recientes en estas áreas.

Estudios recientes han investigado ampliamente las comunicaciones inalámbricas en campo cercano y la modelización de canales para los sistemas emergentes de 6G. Revisiones exhaustivas han examinado los principios de las comunicaciones en campo cercano, las arquitecturas MIMO holográficas, las técnicas de modelización de canales, los métodos de procesamiento de señales y las aplicaciones de comunicación e integración de sensores, además de identificar los principales desafíos asociados con la estimación del canal y el diseño del sistema en entornos de campo cercano28,29. Para abordar el efecto de división de haces en sistemas asistidos por RIS en bandas mmWave/THz, se han propuesto diversas soluciones, incluyendo estrategias de despliegue distribuido de RIS y arquitecturas de RIS asistidas por retardo de tiempo verdadero (TTD). Estos enfoques mejoran el control de haces selectivo en frecuencia y mitigar la degradación por división de haces; sin embargo, a menudo implican mayores costos de despliegue, una mayor complejidad del hardware o la dependencia de componentes de retardo especializados 30,31,32.

La optimización del formado de haces ha recibido considerable atención debido a los efectos combinados del enfoque del haz y la distorsión espacial de banda ancha en sistemas de arreglos de apertura extremadamente grande (ELAA). Estudios previos han explorado métodos de enfoque de retardo de fase, arquitecturas basadas en TTD y marcos de optimización para antenas holográficas de metasuperficies con el fin de mejorar la ganancia del formado de haces y mitigar los efectos de doble banda ancha33,34,35,36. Sin embargo, la mayoría de los estudios relacionados con XL-IMS continúan basándose en suposiciones de onda plana en campo lejano, que resultan inadecuadas para aperturas extremadamente grandes. Como consecuencia, características importantes del campo cercano, como la propagación de ondas esféricas, la no estacionariedad espacial, el acoplamiento mutuo y el enfoque del haz dependiente de la distancia, suelen pasarse por alto37,38. Recientemente, las técnicas de inteligencia artificial han surgido como soluciones prometedoras para el formado de haces y la optimización del canal en campo cercano en redes 6G habilitadas por XL-IMS. En particular, los métodos basados en metaaprendizaje han demostrado una fuerte adaptabilidad y una rápida convergencia bajo condiciones inalámbricas dinámicas con datos de entrenamiento limitados. Estos enfoques ofrecen un potencial significativo para sistemas inteligentes de comunicación en campo cercano y para la optimización futura de redes inalámbricas autónomas39,40.

Las técnicas de formación de haces existentes dependen en gran medida de modelos de canal simplificados de campo lejano que no logran capturar características críticas del campo cercano en estructuras ultra-masivas. Además, las evaluaciones basadas en conjuntos de datos en entornos realistas, como DeepMIMO, siguen siendo limitadas, y la optimización conjunta del modelado del canal en campo cercano y la formación de haces para escenarios dinámicos de usuarios ha recibido escasa atención. Asimismo, la escalabilidad computacional sigue siendo un desafío clave para implementaciones prácticas de 6G habilitadas por XL-IMS. Para abordar estas limitaciones, este estudio propone un marco unificado que combina el modelado de canal basado en ondas esféricas y fundamentado en la física con redes neuronales gráficas (GNN) y mecanismos de atención para la formación de haces en campo cercano. El marco propuesto considera explícitamente la no estacionariedad espacial, las interacciones con metasuperficies y la propagación dependiente de la distancia, y se valida utilizando el conjunto de datos DeepMIMO.

El marco propuesto integra la modelización del canal físico con el aprendizaje profundo para permitir una representación precisa del canal en campo cercano y la optimización del formado de haces en sistemas XL-IMS. Al modelar explícitamente la propagación de ondas esféricas y la no estacionariedad espacial, este estudio facilita un enfoque preciso del haz, al tiempo que mejora la asignación de energía, la ganancia en el formado de haces y la supresión de interferencias. El marco incorpora además una optimización por elemento de las respuestas de fase de la metasuperficie para permitir la dirección adaptativa del haz en entornos de comunicación densos. Utilizando escenarios de propagación realistas del conjunto de datos DeepMIMO, el enfoque propuesto demuestra una mayor eficiencia espectral, un mejor desempeño en el formado de haces y una mayor eficiencia computacional, ofreciendo una solución escalable para redes de comunicación 6G de gran escala habilitadas por XL-IMS.

Protocolo

El marco propuesto para la modelización del canal en campo cercano y formación de haces en sistemas 6G habilitados por XL-IMS combina la modelización basada en principios físicos con la optimización mediante aprendizaje automático para superar las limitaciones de los enfoques convencionales de campo lejano. Se desarrolla y valida un modelo de canal en campo cercano que incorpora la propagación de ondas esféricas y la no estacionariedad espacial, utilizando el conjunto de datos DeepMIMO. La información del canal se representa como un grafo para capturar las dependencias espaciales entre los elementos de la metasuperficie y los usuarios, y se emplea una red de atención-GNN de extremo a extremo para aprender los pesos de formación de haces destinados al enfoque de haces en campo cercano. A diferencia de los métodos convencionales de optimización iterativa, el marco basado en aprendizaje predice directamente las soluciones de formación de haces, reduciendo la complejidad computacional mientras mantiene una alta precisión y adaptabilidad a condiciones dinámicas del canal. El rendimiento se evalúa en términos de tasa alcanzable, ganancia de formación de haces y eficiencia energética, mostrando resultados superiores en comparación con los métodos tradicionales de formación de haces en campo lejano. Figura 1 ilustra el marco general.

A continuación se presentan los pasos propuestos:

Paso 1: Configurar el entorno DeepMIMO

La plataforma DeepMIMO v3.x se configura primero mediante la configuración exterior O1, que utiliza una frecuencia portadora de 28 GHz y un ancho de banda de 100 MHz. En la simulación, el XL-IMS está representado por una matriz plana uniforme de 16×16 con 256 elementos reflectores espaciados λ/2 entre sí. El modelo de propagación elegido es una onda esférica con trayectorias LoS y NLoS.

Paso 2: Definir la geometría de XL-IMS y las ubicaciones de los usuarios

Diseñe el XL-IMS como una metasuperficie plana de 16×16 que comprende 256 elementos reflectantes reconfigurables. Los dispositivos de terminal de usuario se distribuyeron aleatoriamente dentro del rango de campo cercano, desde 0,5 m hasta 10 m del XL-IMS, según el criterio de distancia de Rayleigh.

Paso 3: Generar canales de campo cercano utilizando propagación de ondas esféricas

Modele los canales entre cada elemento de la metasuperficie reconfigurable y el usuario utilizando la propagación de ondas esféricas, que considera la variación de fase inducida por la distancia.

Paso 4: Generar datos del canal de campo cercano

Los terminales de usuario se distribuyeron uniformemente dentro de la zona de campo cercano (0,5-10 m) desde el panel XL-IMS. Se utilizaron tanto las trayectorias de propagación LoS como NLoS generadas por el Escenario Exterior DeepMIMO O1 para generar los canales.

Paso 5: Preparar el conjunto de datos para el entrenamiento y la prueba

El conjunto de datos generado constó de 20.000 muestras, de las cuales 16.000 (80 %) se utilizaron para el entrenamiento y 4.000 (20 %) para las pruebas.

Paso 6: Normalizar las características de entrada y preparar las entradas del modelo

La etapa final del proceso de preparación consistió en realizar una normalización Min-Máx sobre todas las características de entrada, como la magnitud del canal, la fase, la distancia y las coordenadas del usuario. Este proceso escaló los datos y los convirtió en tensores, que se introdujeron en la red GNN con atención. El modelo se optimizó utilizando el optimizador Adam con una tasa de aprendizaje de 0,001 y 50 épocas.

Paso 7: Aplicar el mecanismo de atención

Agregue un mecanismo de atención para considerar la información global del grafo y capturar dependencias de largo alcance entre los nodos del grafo. Esto ayuda al modelo a enfocarse en características espaciales importantes.

Paso 8: Predecir los pesos de formación de haces

Prediga los pesos de formación de haces y los valores de desplazamiento de fase utilizando la incrustación de atención GNN. Los procedimientos complejos, laboriosos e iterativos de formación de haces se sustituyen por el método de predicción.

Paso 9: Evaluar las métricas de rendimiento

Para evaluar qué tan bien funcionan la comunicación y la formación de haces, calcule indicadores clave de rendimiento (KPI) como la tasa alcanzable, la ganancia de formación de haces, la eficiencia espectral, la eficiencia energética y la SINR.

Paso 10: Comparar con métodos de referencia

Compare el algoritmo propuesto con los algoritmos tradicionales, incluidos ZF, MMSE, SDR y AO.

Definición del modelo del sistema

El sistema propuesto considera una red inalámbrica 6G habilitada por un XL-IMS que comprende 256 elementos reflectores reconfigurables que controlan la propagación de ondas electromagnéticas mediante desplazamientos de fase ajustables. Dado que los usuarios operan en la región de campo cercano, la suposición convencional de onda plana en campo lejano deja de ser válida, lo que requiere considerar la propagación de ondas esféricas, la atenuación dependiente de la distancia y la no estacionariedad espacial. El límite entre las regiones de campo cercano y campo lejano está determinado por la distancia de Rayleigh, que depende del tamaño de la metasuperficie y de la longitud de onda portadora, y marca la transición desde los efectos de frente de onda esférico hacia la propagación de onda plana. Esto se describe de la siguiente manera:

figure-protocol-1 (1)

Aquí, D es el tamaño de la metasuperficie, λ es la longitud de onda y R es la distancia de Rayleigh. Un fenómeno de campo cercano ocurre en el canal de comunicación cuando un usuario se encuentra en una posición más cercana a R que su valor real. A medida que la señal atraviesa diferentes componentes de la metasuperficie, experimenta variaciones distintas de fase y amplitud.

El canal desde la n-ésima meta-superficie hasta el usuario utiliza un modelo de onda esférica para la propagación en campo cercano, el cual se representa mediante la ecuación del coeficiente de canal de la siguiente manera:

figure-protocol-2 (2)

Aquí, α se refiere al parámetro de pérdida de trayectoria, λ se refiere a la longitud de onda de la portadora, y dn es la distancia del usuario desde el componente.

En este caso, βn es el factor de pérdida por trayectoria del elemento XL-IMS nº  y puede expresarse como βn = dn−α, donde α representa el exponente de pérdida por trayectoria. Cabe señalar que dn es la distancia euclidiana desde la posición del usuario hasta el elemento nº de la metasuperficie. Los cambios en el canal con respecto al espacio se deben a las diferencias significativas en dn entre distintos elementos de la metasuperficie, a diferencia de la situación con canales de campo lejano. En general, el vector de canal puede explicarse de la siguiente manera:

figure-protocol-3 (3)

La señal de entrada recibida por el usuario depende del ajuste de fase del sistema XL-IMS. Considere θ = [θ1, θ2, …., θN] para representar el desplazamiento de fase logrado mediante la metasuperficie. Entonces, la señal de entrada puede expresarse como:

figure-protocol-4 (4)

donde Φ = diag(ejθ1, ….., ejθN) es la señal transmitida, w es el vector de precodificación de codificación básica y n representa el ruido. El vector de canal de campo cercano se define como h ∈ ℂN×1, la matriz diagonal de desplazamiento de fase del XL-IMS como Φ ∈ ℂN×N, el vector de formación de haces como x ∈ ℂN×1 y la señal recibida como y ∈ ℂ. El término de ruido aditivo se define como nCN (0, σ2). Estas dimensiones mantienen la corrección matemática de la formulación.

En este caso, ws es el vector de precodificación de la estación base que se utiliza para predecodificar el símbolo transmitido (s). Durante la evaluación del rendimiento, se implementan en la estación base enfoques comunes de precodificación digital, como ZF y MMSE, utilizando realizaciones de canal cercanas similares. Sin embargo, el nuevo enfoque busca optimizar la matriz de desplazamiento de fase XL-IMS (θ) mediante el mecanismo de aprendizaje por atención GNN.

Para concentrar la energía en la región de campo cercano, debe ser posible lograr un diseño θ en el que ocurra interferencia constructiva, para el usuario. La estrategia de formación de haces tiene como objetivo maximizar la eficiencia espectral o la potencia de la señal recibida. La figura 2 describe la arquitectura del modelo de sistema de comunicación de campo cercano basado en el enfoque XL-IMS.

Modelado de canal en campo cercano

El modelo propuesto de redes de comunicación 6G basadas en XL-IMS para la zona cercana fue diseñado específicamente para imitar las condiciones de propagación cerca de la distancia de Rayleigh desde la metasuperficie. En la región cercana, la propagación es esférica, con valores de fase cambiantes y parámetros espaciales no homogéneos a través de la metasuperficie, en contraste con los modelos convencionales de propagación en campo lejano que asumen ondas planas. En el presente estudio, se utilizó un modelo de onda esférica basado en principios físicos para diseñar una matriz precisa de respuesta al impulso del canal que tenga en cuenta las ubicaciones físicas tanto de los elementos de la metasuperficie como de los terminales de usuario.

Representación del canal basada en la distancia

La distancia entre cada componente de la metasuperficie y el usuario es un factor crucial para construir el modelo de canal en el régimen de campo cercano. La longitud pn entre las ubicaciones del usuario pu y el componente n-ésimo del XL-IMS viene dada por:

figure-protocol-5 (5)

Este valor varía significativamente a través de la metasuperficie debido a su área extremadamente grande, lo que provoca tiempos de propagación y desplazamientos de fase desiguales que deben tenerse en cuenta en el modelo.

Modelo de canal de onda esférica

El coeficiente del canal entre el elemento n-ésimo y el usuario se determina utilizando el modelo de onda esférica descrito en la Ecuación (2), que captura las variaciones de fase y amplitud dependientes de la distancia. Para la generación del conjunto de datos y el entrenamiento del modelo, los coeficientes del canal se obtienen del marco de trabajo de trazado de rayos DeepMIMO, que incorpora la propagación multiperfil de línea de visión (LoS) y sin línea de visión (NLoS) basada en estructuras ambientales realistas. A partir de lo anterior, puede construir la matriz de respuesta del canal a partir de las respuestas del canal para los N elementos de la superficie meta, como se muestra en la Ecuación (3).

No estacionariedad espacial de los canales de campo cercano y relevancia del modelo

A diferencia de los canales de campo lejano, los canales de campo cercano presentan no estacionariedad espacial, donde las señales recibidas varían a lo largo de la superficie metamatérica, lo que permite un enfoque de haz dependiente de la ubicación. Esta información espacial está incorporada en la matriz de respuesta del canal y es capturada por el modelo de atención GNN. Figura Suplementaria 1 ilustra el marco propuesto de modelado de canal de campo cercano para el sistema de comunicación 6G basado en XL-IMS y la generación de datos de canal realistas para el formado de haces basado en aprendizaje profundo.

Generación del conjunto de datos

La generación de datos se realizó utilizando el marco DeepMIMO, que proporciona simulaciones de canales realistas basadas en trazado de rayos, que incorporan la geometría del entorno, la consistencia espacial y la movilidad del usuario. Las respuestas del canal para múltiples ubicaciones de usuarios en campo cercano se generaron utilizando el escenario exterior O1 a una frecuencia portadora de 28 GHz y un ancho de banda de 100 MHz. El XL-IMS constaba de 256 elementos reflectantes distribuidos uniformemente, y las ubicaciones de los usuarios se seleccionaron dentro de la región de campo cercano según el criterio de Rayleigh. Los coeficientes del canal, las ganancias de trayectoria y la información espacial se extrajeron utilizando la biblioteca Python DeepMIMO. Tabla Suplementaria 1 resume los parámetros de simulación y reproducibilidad. El modelo se entrenó mediante aprendizaje supervisado, utilizando características del estado del canal como entradas y pesos de formación de haces optimizados basados en principios físicos como etiquetas objetivo.

Creación de características de entrada y estructura del conjunto de datos

A continuación, los datos brutos de los canales se convirtieron en características para la entrada a modelos de aprendizaje profundo. Estas características incluían las magnitudes y fases de la respuesta del canal como componentes separados. También se podrían incluir otros parámetros de entrada según los requisitos del problema. Por ejemplo, las coordenadas de los usuarios, las distancias y algunos parámetros espaciales también podrían considerarse como características. El conjunto de datos se dividió en conjuntos de entrenamiento y prueba en una proporción de 80:20.

Preparación del conjunto de datos para el entrenamiento

El último paso consistió en normalizar el conjunto de datos preparado y convertirlo en tensores adecuados para la entrada en la arquitectura de atención GNN para el entrenamiento. El conjunto de datos de entrenamiento se utilizó para aprender la correspondencia entre el estado del canal y los pesos óptimos de formación de haces, mientras que el conjunto de datos de prueba se empleó para evaluar la eficacia del modelo. Este conjunto de datos bien preparado facilitó y mejoró el proceso de aprendizaje. Supplementary Table 2 muestra los detalles descriptivos del conjunto de datos DeepMIMO.

Representación de características

La etapa de representación de características transformó los datos del canal de campo cercano con valores complejos en un formato adecuado para el aprendizaje profundo. Las respuestas del canal se descompusieron en características que capturan las propiedades espaciales y de propagación, al tiempo que se preserva la información esencial del campo cercano para el aprendizaje. Figura suplementaria 2 ilustra el conjunto de datos DeepMIMO utilizado en este proceso. Los datos del canal del entorno de campo cercano se representaron como números complejos hn, con componentes reales e imaginarios que representan la información de fase y amplitud de los coeficientes del canal. Para permitir un uso eficaz en algoritmos de aprendizaje automático, los coeficientes se descompusieron en sus partes reales (Rehn) e imaginarias (Imhn). Los datos también podrían representarse mediante la magnitud hn y la fase de los coeficientes ∠hn.

Extracción de características espaciales

Además del coeficiente del canal, se incluyeron características espaciales para tener en cuenta la naturaleza geométrica del entorno de campo cercano. Esto incluyó la distancia dn desde cada elemento de la metasuperficie hasta el receptor, junto con las coordenadas del receptor (x, y, z). De esta manera, el modelo tuvo en cuenta el hecho de que las características de la señal pueden depender de la posición espacial del par transmisor-receptor, una propiedad importante en la propagación en campo cercano.

Normalización y preparación de la entrada del modelo

Como paso preliminar antes de proporcionar las entradas al modelo, se realizó un proceso de normalización para evitar inestabilidad numérica y acelerar la convergencia. Los vectores estructurados se dividieron en conjuntos de datos de entrenamiento y prueba, denotados por (Xtrain, Xtest). De esta manera, las entradas se proporcionaron posteriormente a los modelos GNN y de atención.

Basándose en la representación de características en la Figura Suplementaria 2, se utilizaron diferentes tipos de características en este conjunto de datos, incluyendo los coeficientes de canal hn, que indicaban la respuesta de señal compleja de todos los elementos de la metasuperficie. Otra característica fue la distancia dn, que en este caso indicaba los efectos de propagación. Aunque las componentes imaginaria y real proporcionan una descripción numérica de la señal, las partes de magnitud y fase ofrecen una descripción explícita de la intensidad de la señal y del desplazamiento de fase, respectivamente. La coordenada de posición del usuario (x, y, z) fue otra característica importante que mejoró la percepción espacial del modelo.

Diseño de aprendizaje profundo mediante GNN para la modelización de dependencias espaciales integrado con un mecanismo de atención híbrida para el aprendizaje del contexto global

Este algoritmo de aprendizaje fue desarrollado para entrenar de manera eficiente el complejo canal XL-IMS de campo cercano, con sus características espaciales y de propagación, utilizando redes neuronales gráficas (GNN) y un mecanismo de atención. Dado que los elementos de la metasuperficie están altamente correlacionados entre sí y sus interacciones son no uniformes dentro de la zona de campo cercano, una red completamente conectada no es adecuada para representar correctamente el canal. Por lo tanto, en este enfoque, la metasuperficie se representa como un grafo, donde cada elemento actúa como un nodo y las interacciones entre ellos como aristas. La GNN capturó dependencias espaciales localizadas entre nodos vecinos, mientras que el mecanismo de atención mejoró el aprendizaje de las dependencias globales.

Representación gráfica de XL-IMS

El XL-IMS se crea como un grafo G = (V, E), donde cada vértice vnV representa un elemento de la meta-superficie, mientras que las aristas eijE representan las relaciones espaciales entre los elementos. Cada vértice tiene un vector de características xn, que se obtiene mediante la fase de representación de características. La matriz de adyacencia A captura la conectividad entre vértices que están cercanos entre sí o dentro de ciertas restricciones de distancia. Esta formulación de grafo se utiliza para incorporar la información espacial existente en la propagación en campo cercano.

Para lograr la reproducibilidad, la conectividad del grafo se determina utilizando el enfoque de los K Vecinos Más Cercanos con k igual a 8. Sean pi y pj los vectores de ubicación de las celdas XL-IMS de la i-ésima y la j-ésima, respectivamente. La distancia entre dos vértices cualesquiera se mide mediante la métrica euclidiana de la siguiente manera: dij = ||pipj||2. Habrá una arista entre los vértices i y j si el vértice j está incluido en el grupo de los ocho vecinos más cercanos al vértice i. Por lo tanto, la matriz de adyacencia se construye con la siguiente regla: Aij = 1 si jNk(i) y Aij = 0 en caso contrario.

En la GNN propuesta, las actualizaciones para cada nodo se calculan en función de la información procedente de otros nodos vecinos. En particular, la propagación de la capa l puede expresarse como sigue:

figure-protocol-6 (6)

donde hi(l) representa el vector de características del vértice i en la capa l, N(i) es la vecindad del vértice i, W(l) es la matriz de pesos aprendible y σ(·) simboliza una función de activación no lineal.

El modelo de atención GNN consistió en tres capas de convolución de grafos con dimensiones ocultas establecidas en 128, y se utilizó la unidad lineal rectificada (ReLU) como función de activación. La generación del grafo se realizó mediante el método de los k vecinos más cercanos (k=8). Cada característica XL-IMS actúa como un nodo, mientras que las aristas se forman en función de la distancia euclidiana entre nodos adyacentes. Para extraer dependencias espaciales globales, utilizamos una red de autoatención multi-cabeza con 4 cabezas. La probabilidad de abandono (dropout) se estableció en 0,3 para prevenir el sobreajuste.

Mecanismo de atención

Para modelar las dependencias de largo alcance que existían más allá del rango de vecindad local, se introdujo la atención en el modelo, que funciona de la siguiente manera:

figure-protocol-7 (7)

donde eij = LeakyReLU(aT[Whi | Whj]) es la importancia de los nodos i y j. Con este modelo, se pueden asignar diferentes niveles de importancia a los nodos según sus funciones, facilitando que el modelo comprenda el contexto global a través de la metasuperficie. El marco híbrido captura tanto la información espacial local como global, y las características aprendidas se procesan mediante capas completamente conectadas para generar los pesos de formación de haces. Como se muestra en las Figuras Suplementarias 3 y 4, la red neuronal gráfica (GNN) modela las dependencias espaciales locales mediante el paso de mensajes y la agregación de características, mientras que el mecanismo de atención captura las interacciones globales entre los elementos de la metasuperficie, posibilitando una formación eficaz de haces en campo cercano. Se calculan pesos de atención para cuantificar la relevancia de los pares de nodos, asignando mayor importancia a las interacciones más informativas. Utilizando estos pesos, cada nodo agrega información de todos los demás nodos, permitiendo que el modelo capture dependencias globales más allá de las vecindades locales. La fusión ponderada resultante de características genera una representación optimizada de las características que enfatiza las características espaciales importantes mientras suprime la información menos relevante, apoyando así una optimización eficaz de la formación de haces y el enfoque de energía.

Optimización de la formación de haces

La etapa de optimización de formación de haces determinó los desplazamientos de fase XL-IMS y los pesos de formación de haces para enfocar la energía en usuarios del campo cercano. A diferencia de la orientación convencional de haces en campo lejano, la formación de haces en campo cercano concentra la energía en ubicaciones espaciales específicas. En el marco propuesto, un modelo de atención GNN aprendió directamente los parámetros óptimos de formación de haces a partir de las características del canal, reduciendo la complejidad de los métodos iterativos de optimización. La señal recibida del usuario se indica en la Ecuación (4).

Los datos de entrenamiento se obtuvieron de DeepMIMO para cada realización del canal, y los correspondientes desplazamientos de fase XL-IMS se determinaron utilizando el algoritmo AO. Se utilizó la matriz del canal en campo cercano h y la matriz de desplazamientos de fase XL-IMS para calcular el vector de desplazamiento de fase θ maximizando la potencia de la señal recibida:

figure-protocol-8 (8)

figure-protocol-9 (9)

El optimizador AO se ejecutó durante 100 iteraciones hasta alcanzar el umbral de convergencia deseado de 10−4. Estos valores optimizados sirvieron como etiquetas de entrenamiento para nuestro modelo GNN con atención. El objetivo era lograr una interferencia constructiva para enfocar eficazmente el haz en campo cercano y aumentar la potencia de la señal recibida. En lugar de utilizar métodos convencionales de optimización, como SDR u AO, el problema se resolvió mediante un enfoque basado en aprendizaje. Específicamente, el problema de optimización de formación de haces fue aproximado por un modelo de aprendizaje profundo fΘ(⋅).

Se utilizó aprendizaje supervisado para entrenar el modelo GNN con atención, empleando como objetivos de entrenamiento los vectores de desplazamiento de fase de formación de haces óptimos proporcionados por el algoritmo AO. Específicamente, denotemos el vector de desplazamiento de fase óptimo generado por AO como θAO,i y las predicciones de la red como figure-protocol-10. Entonces, el criterio de entrenamiento se formuló de la siguiente manera:

figure-protocol-11 (10)

donde N es el número de muestras de entrenamiento.

Algoritmo 1: La formación de haces en campo cercano mediante un modelo con atención de GNN se presenta en el Archivo Suplementario 1. En este algoritmo, el primer paso consistió en configurar los parámetros del sistema y la base de datos DeepMIMO para crear condiciones de canal realistas. La característica del canal en campo cercano para cada muestra se calculó utilizando el modelo de onda esférica, y luego se extrajeron de la base de datos características importantes, como los coeficientes del canal y las características espaciales. Las características extraídas se convirtieron a una forma estructurada y luego se representaron como un grafo, con los elementos de la metasuperficie como nodos. El modelo de aprendizaje profundo se generó utilizando capas de GNN para capturar dependencias espaciales locales, y se introdujo un mecanismo de atención para aprender dependencias globales. El marco de aprendizaje profundo se entrenó mediante aprendizaje supervisado con una pérdida de MSE entre los desplazamientos de fase predichos y las etiquetas de desplazamientos de fase óptimos generadas por AO.

Esta implementación se realizó con Python y PyTorch. Las muestras para el canal DeepMIMO se obtuvieron del escenario exterior O1. Estos coeficientes de canal se convirtieron en grafos y se procesaron utilizando una GNN con tres capas y un mecanismo de atención multinúcleo. El modelo se entrenó utilizando el optimizador Adam con una función de pérdida MSE. Este modelo generó desplazamientos de fase y pesos para la formación de haces en usuarios del campo cercano, y los resultados se evaluaron en términos de tasa, eficiencia y SINR.

Resultados

El rendimiento del marco introducido de modelado de canal de campo cercano y formación de haces para IMS de gran escala en redes de comunicación 6G se evalúa utilizando el conjunto de datos DeepMIMO, que ofrece entornos de propagación prácticos y datos de canal espacialmente consistentes. Para configurar este conjunto de datos, deben generarse muchas muestras de canal que representen diversas posiciones de usuario en el campo cercano de la superficie meta. Específicamente, este estudio utiliza hasta 10 000–20 000 muestras recopiladas bajo diferentes condiciones de propagación y ubicaciones de usuario. Se utilizó una proporción de 80:20 para dividir estas muestras de canal en un 80 % para entrenamiento y un 20 % para pruebas. En este sentido, el conjunto de prueba evalúa la capacidad del modelo para generalizar, mientras que el conjunto de entrenamiento proporciona una base para el aprendizaje.

Los resultados experimentales demuestran que el marco propuesto GNN-Attention supera a los métodos convencionales de formación de haces en campo lejano y basados en optimización. Al combinar la modelización del canal de onda esférica con la extracción de características espaciales basada en aprendizaje profundo, el enfoque propuesto logra un mayor ganancia en la formación de haces, eficiencia espectral y rendimiento en la concentración de energía. El rendimiento se evalúa mediante la tasa alcanzable, la ganancia en la formación de haces y la eficiencia energética, que miden la capacidad de comunicación, la efectividad en el enfoque de la señal y la eficiencia en la transmisión de datos en relación con el consumo de potencia, respectivamente.

El método propuesto se compara con técnicas convencionales de formación de haces, incluyendo ZF y MMSE, así como métodos basados en optimización como SDR y AO. Mientras que los enfoques de campo lejano están limitados por supuestos de onda plana y presentan un rendimiento deficiente en entornos de XL-IMS de campo cercano, los métodos de optimización suelen tener una alta complejidad computacional. En contraste, el marco GNN-attention proporciona una formación de haces eficiente con menor sobrecarga computacional. Para una comparación justa, todos los métodos se evaluaron utilizando los mismos canales de campo cercano generados por DeepMIMO, configuración de XL-IMS, frecuencia portadora, ubicaciones de usuarios, potencia de transmisión y condiciones de relación señal-ruido (SNR). Se asumió que ZF y MMSE disponían de la misma información del estado del canal, mientras que SDR y AO se implementaron bajo las mismas restricciones de potencia y desplazamiento de fase utilizando configuraciones de parámetros estándar basadas en la literatura.

Validación del modelado de canales de campo cercano

Se utilizan métodos de referencia, incluyendo ZF, MMSE, SDR y AO, para comparar el rendimiento en tasa alcanzable del modelo propuesto de formación de haces basado en red neuronal gráfica con atención en Figura 3. A medida que la SNR aumenta de 0 a 30 dB, todos los métodos muestran tasas alcanzables mejoradas; sin embargo, el modelo propuesto supera consistentemente a los métodos de referencia. Alcanza 2,1 bps/Hz a 0 dB, 7,8 bps/Hz a 15 dB y 11,6 bps/Hz a 30 dB, superando el rendimiento de ZF, MMSE, SDR y AO en todos los niveles de SNR. Tabla 1 presenta una comparación de las tasas alcanzables frente a la SNR.

Figura 4 compara la ganancia de formación de haces del modelo propuesto basado en GNN con atención frente a métodos convencionales, incluyendo ZF, MMSE, SDR y AO, como función de la distancia del usuario en la región de campo cercano. A medida que aumenta la distancia del usuario, la potencia de la señal formada por el haz recibida disminuye debido al mayor pérdida de trayectoria por propagación, lo que resulta en una reducción de la ganancia de formación de haces en todos los métodos. Sin embargo, el marco propuesto basado en GNN con atención logra consistentemente la ganancia más alta de formación de haces, alcanzando aproximadamente 28 dB a 1 m, 25 dB a 4 m y 22 dB a 7 m, superando a SDR, AO, MMSE y ZF en todas las distancias evaluadas. Estos resultados demuestran la capacidad superior de enfoque de haz en campo cercano y la retención de ganancia del marco propuesto, lo que conduce a una mayor eficiencia en la formación de haces en comparación con los métodos existentes.

Rendimiento del marco de aprendizaje con atención GNN

Figura 5 compara la eficiencia espectral del esquema propuesto de formación de haces con atención GNN frente a ZF, MMSE, SDR y AO en valores de SNR desde 0 hasta 30 dB. Aunque la eficiencia espectral aumenta para todos los métodos con un SNR más alto, el enfoque propuesto logra consistentemente el mejor desempeño, alcanzando 1,8 bps/Hz a 0 dB, 6,8 bps/Hz a 15 dB y 10,5 bps/Hz a 30 dB, superando a todos los métodos de referencia. Figura 6 compara la eficiencia energética del sistema propuesto de formación de haces con atención GNN frente a ZF, MMSE, SDR y AO bajo condiciones variables de SNR. La eficiencia energética mejora con el aumento del SNR para todos los métodos; sin embargo, el enfoque propuesto logra consistentemente el desempeño más alto, alcanzando aproximadamente 2,5 bits/julio a 0 dB, 7,2 bits/julio a 15 dB y 9,8 bits/julio a 30 dB, superando a todas las técnicas de referencia.

Evaluación del conjunto de datos y representación de características

Figura 7 ilustra el comportamiento de convergencia del modelo propuesto de GNN con atención en términos del error cuadrático medio (MSE) a lo largo de las épocas de entrenamiento. El MSE disminuye rápidamente durante las primeras etapas del entrenamiento, pasando de aproximadamente 0,69 en la época 5 a 0,22 en la época 20, y disminuyendo aún más hasta aproximadamente 0,08 en la época 35. El modelo converge gradualmente hacia la época 50, alcanzando un MSE de aproximadamente 0,04, lo que indica un entrenamiento estable y un aprendizaje efectivo de las características subyacentes del canal.

Resultados de la optimización de formación de haces

Figura 8 compara el rendimiento de la tasa total del método propuesto de formación de haces con atención GNN frente a ZF, MMSE, SDR y AO a medida que el número de usuarios aumenta de 2 a 12. Aunque todos los métodos logran tasas totales más altas con más usuarios, el enfoque propuesto ofrece consistentemente el mejor rendimiento, alcanzando 12,5 bps/Hz para 2 usuarios, 31,6 bps/Hz para 6 usuarios y 50,3 bps/Hz para 12 usuarios, superando a todos los métodos de referencia en diferentes densidades de usuarios.

Tabla 2 compara el rendimiento multiusuario del marco propuesto de formación de haces con atención GNN frente a ZF, MMSE, SDR y AO. El método propuesto alcanza la mayor eficiencia multiusuario (92,5 %), SINR (24,8 dB) y ganancia de capacidad (50,3 bps/Hz), demostrando una escalabilidad superior, gestión de interferencias y asignación de recursos en comparación con los métodos de referencia. Figura 9 presenta una comparación de las funciones de distribución acumulativa (CDF) del SINR. El enfoque propuesto exhibe una distribución desplazada hacia la derecha, lo que indica valores de SINR consistentemente más altos en todos los usuarios. En la mediana (percentil 50), alcanza un SINR de aproximadamente 25 dB, superando a SDR (23 dB), AO (22 dB), MMSE (20 dB) y ZF (17 dB). El rendimiento superior del modelo propuesto en términos de SINR se debe a su capacidad para capturar tanto las dependencias espaciales locales mediante GNN como las interacciones globales a través de mecanismos de atención, permitiendo una formación de haces eficaz en campo cercano. Los resultados de la CDF demuestran una gestión de interferencias más robusta y valores de SINR consistentemente más altos que los métodos convencionales ZF, MMSE, SDR y AO.

Tabla 3 presenta el rendimiento medio, la desviación estándar y los intervalos de confianza del 95 % obtenidos a partir de cinco ejecuciones experimentales independientes, lo que demuestra la estabilidad y reproducibilidad del marco propuesto. Tabla 4 compara la complejidad computacional y el tiempo de inferencia del esquema propuesto de formación de haces con GNN y mecanismo de atención frente a los métodos convencionales. Durante el entrenamiento, el costo computacional está determinado principalmente por el paso de mensajes en grafos y el mecanismo de atención, lo que resulta en una complejidad de O(E·L·F2 + N2). A pesar de esta sobrecarga durante el entrenamiento, el formador de haces aprendido elimina la necesidad de optimización iterativa durante la implementación. El modelo propuesto alcanza un tiempo promedio de inferencia de 4,9 ms, notablemente inferior al de SDR (85,4 ms), AO (63,7 ms), MMSE (15,6 ms) y ZF (12,8 ms). Además, el análisis de escalabilidad indica un rendimiento estable conforme aumenta el número de usuarios y elementos de la superficie metamatérica, destacando la idoneidad del marco propuesto para sistemas de comunicación 6G a gran escala habilitados por XL-IMS.

Estudio de ablación

El efecto de los componentes individuales en el marco se puede evaluar mediante un análisis de ablación, en el cual los componentes se omiten o modifican, como la red neuronal gráfica (GNN), la atención y el modelado físico del canal en campo cercano. El marco completo incluye los tres componentes, mientras que los modelos de ablación consisten en: (i) solo el modelo GNN, (ii) solo el modelo de atención, y (iii) sin el modelo de onda esférica basado en la física (suposición de campo lejano). La evaluación del rendimiento se realiza utilizando métricas como tasa alcanzable, ganancia de formación de haces y SINR. Los resultados muestran que el rendimiento general del sistema se ve significativamente afectado por los componentes, especialmente por el modelo de canal basado en la física, que tiene el mayor efecto perjudicial cuando se omite. Esto sugiere la importancia de modelar con precisión el canal en el régimen de campo cercano.

A partir de los resultados de ablación en la Tabla 5, puede verificarse la importancia de cada parte de la arquitectura propuesta. Como se muestra en los resultados experimentales anteriores, el modelo con todas las partes alcanza el mejor desempeño, con una tasa alcanzable de 11,6 bps/Hz, una ganancia de formación de haces de 28 dB y una SINR de 25 dB, lo que demuestra que la arquitectura propuesta funciona bien. Sin el mecanismo de atención, el modelo alcanza solo 10,2 bps/Hz, lo que indica que el contexto global de la señal se debilita. Además, eliminar el componente GNN da como resultado un desempeño deficiente de 9,8 bps/Hz, lo que indica que modelar las dependencias espaciales es necesario para las comunicaciones en campo cercano. La mayor degradación del desempeño se observa cuando se ignora el modelo de onda esférica basado en la física, obteniéndose una tasa alcanzable de 8,5 bps/Hz y una SINR de 19,2 dB, lo que demuestra que también es necesario el modelado del canal en campo cercano.

En resumen, los resultados experimentales confirman los objetivos de investigación de desarrollar modelos de canal y formación de haces basados en el campo cercano de ondas electromagnéticas, con aplicación a redes 6G habilitadas para XL-IMS. La arquitectura GNN-attention logró un rendimiento superior en términos de tasa alcanzable, ganancia de formación de haces, eficiencia espectral, eficiencia energética y SINR en comparación con enfoques tradicionales como los métodos ZF, MMSE, SDR y AO. El análisis de ablaciones mostró que el uso de modelos físicos para ondas esféricas, redes neuronales gráficas y mecanismos de atención es altamente valioso para mejorar el rendimiento.

Disponibilidad de datos

Los conjuntos de datos y materiales complementarios generados y analizados durante este estudio están disponibles públicamente en el repositorio Zenodo en https://doi.org/10.5281/zenodo.21037047. Los conjuntos de datos de simulación se generaron utilizando el Repositorio Python DeepMIMO con el escenario de trazado de rayos exterior O1, una frecuencia portadora de 28 GHz y la configuración XL-MIMO de campo cercano. El Repositorio Python DeepMIMO está disponible en: https://github.com/DeepMIMO/DeepMIMO-python.

figure-results-1
Figura 1: Arquitectura general del trabajo propuesto. Ilustración esquemática de toda la tubería del método propuesto de modelado de canal en campo cercano y formación de haces. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-2
Figura 2: Arquitectura del modelo del sistema. Un diagrama esquemático ilustra la arquitectura a nivel de sistema de la comunicación 6G basada en XL-IMS con enfoque de haz en campo cercano. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-3
Figura 3: Resultado de la tasa alcanzable frente a la relación señal-ruido (SNR). Rendimiento de la tasa en función de la SNR para los enfoques propuestos y existentes. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-4
Figura 4: Ganancia de formación de haces frente a distancia. Ganancia de formación de haces obtenida mediante diferentes métodos de formación de haces en función de la distancia del usuario en la región de campo cercano, que ilustra la eficacia del enfoque espacial de la señal y la retención de ganancia con el aumento de la distancia. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-5
Figura 5: Resultado de la eficiencia espectral frente a la relación señal-ruido (SNR). Comparación de la eficiencia espectral en distintos valores de SNR. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-6
Figura 6: Resultado de la eficiencia energética frente a la relación señal-ruido (SNR). Rendimiento de eficiencia energética a diferentes valores de SNR. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-7
Figura 7: Resultado de la convergencia del MSE. Convergencia de la pérdida del MSE durante el entrenamiento. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-8
Figura 8: Resultado de la tasa de suma frente al número de usuarios. El rendimiento de la tasa de suma a medida que aumenta el número de usuarios. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-9
Figura 9: Resultado de la comparación de SINR con CDF. Comparación de SINR basada en gráficos CDF. Haga clic aquí para ver una versión más grande de esta figura.

MétodoTasa media alcanzable (bps/Hz)Nivel de rendimiento
Propuesto (GNN-attention)7.36*****
SDR6.66****
AO6.5****
MMSE6.03***
ZF5.23***

Tabla 1: Comparación de la tasa alcanzable. Ilustra la tasa de rendimiento de las técnicas propuestas y existentes.

MétodoEficiencia multiusuario (%)Manejo de interferencia (SINR, dB)Mejora de capacidad (bps/Hz)
Propuesto (GNN-Attention)92.5 ± 0.824.8 ± 0.550.3 ± 0.7
SDR86.3 ± 1.122.1 ± 0.745.0 ± 0.9
AO84.7 ± 1.021.5 ± 0.843.2 ± 1.0
MMSE78.9 ± 1.319.2 ± 0.938.7 ± 1.2
ZF72.5 ± 1.517.0 ± 1.033.5 ± 1.4

Tabla 2: Resultado experimental del rendimiento de escalabilidad. Muestra el rendimiento de escalabilidad en entornos de comunicación multiusuario.

MétricaMediaDesv. estándarIC 95%
Tasa alcanzable11.6 ± 0.210.21[11.42,11.78]
Eficiencia espectral10.5 ± 0.180.18[10.34,10.66]
Eficiencia energética9.8 ± 0.150.15[9.67,9.93]
SINR25.0 ± 0.420.42[24.63,25.37]

Tabla 3:  Análisis estadístico. El rendimiento del análisis estadístico se evalúa utilizando la media, la desviación estándar y los intervalos de confianza.

MétodoComplejidad de entrenamientoComplejidad de inferenciaTiempo promedio de inferencia (ms)
ZFN/AO(N³)12.8
MMSEN/AO(N³)15.6
SDRN/AO(N³·⁵)85.4
AON/AO(IN²)63.7
Propuesto GNN-attentionO(E·L·F² + N²)O(E·L·F² + N²)4.9

Tabla 4:  Análisis de complejidad computacional y escalabilidad. Muestra el análisis de complejidad computacional y escalabilidad del trabajo propuesto.

Variante del modeloTasa alcanzable (bps/Hz)Ganancia de formación de haces (dB)SINR (dB)Eficiencia espectral (bps/Hz)
Modelo propuesto completo (GNN + atención + basado en física)11.6 ± 0.228.0 ± 0.425.0 ± 0.310.5 ± 0.2
Sin mecanismo de atención10.2 ± 0.325.5 ± 0.522.8 ± 0.49.1 ± 0.3
Sin GNN (solo MLP)9.8 ± 0.324.0 ± 0.621.5 ± 0.58.7 ± 0.3
Sin modelo de canal basado en física (suposición de campo lejano)8.5 ± 0.421.0 ± 0.719.2 ± 0.67.4 ± 0.4

Tabla 5: Resultado del estudio de ablación. Muestra el estudio de ablación de todos los componentes del modelo.

Figura suplementaria 1. Modelado de canal en campo cercano. Ilustración esquemática del modelado de canal en campo cercano basado en ondas esféricas y la construcción de la matriz.Haga clic aquí para descargar este archivo.

Figura suplementaria 2. Características del conjunto de datos DeepMIMO utilizadas para la evaluación. Características extraídas del conjunto de datos DeepMIMO y utilizadas como entradas del modelo para entrenamiento y evaluación.Haga clic aquí para descargar este archivo.

Figura suplementaria 3. RNA para la modelización de la dependencia espacial. Modelización de la correlación espacial mediante RNA.Haga clic aquí para descargar este archivo.

Figura suplementaria 4. Mecanismo de atención para la conciencia del contexto global. Ilustración gráfica del módulo de atención para capturar información del contexto global.Haga clic aquí para descargar este archivo.

Tabla suplementaria 1. Entorno de simulación. Muestra la configuración de simulación utilizada para el entrenamiento y la prueba de los modelos.Haga clic aquí para descargar este archivo.

Tabla suplementaria 2. Descripción del conjunto de datos. Muestra las características del conjunto de datos DeepMIMO que se utilizarán en el entrenamiento y la evaluación.Haga clic aquí para descargar este archivo.

Archivo suplementario 1: Flujo de trabajo del marco propuesto de formación de haces basado en GNN con atención. El algoritmo describe los pasos para la generación del conjunto de datos, la construcción del grafo, el entrenamiento del modelo, la optimización de la formación de haces y la evaluación del rendimiento.Haga clic aquí para descargar este archivo.

Discusión

El algoritmo propuesto utiliza precodificación no lineal para modelar la propagación de ondas esféricas en campo cercano, logrando un enfoque de haz más preciso que los algoritmos basados en precodificación lineal, como ZF, MMSE, SDR y AO. Aunque los resultados de los algoritmos SDR y AO son casi óptimos, la red propuesta con atención GNN alcanza un mejor rendimiento con un costo computacional significativamente menor, lo cual es fundamental para la futura implementación de XL-IMS en redes 6G 21,26,27.

Como se mencionó anteriormente, para verificar empíricamente este argumento desde una perspectiva cuantitativa, se realizó un análisis de complejidad, y los resultados se proporcionan en la Tabla 4. La arquitectura propuesta de GNN con atención tiene una complejidad computacional de O(E · d + N2 · d) cuando se trata de su proceso de entrenamiento, donde E hace referencia a los bordes del grafo, N a los elementos de la metasuperficie, y d a la dimensionalidad de la característica oculta. Lo más importante es que, al utilizar el marco de aprendizaje durante la inferencia, los pesos de formación de haces pueden calcularse en una sola pasada con O(N · d) complejidad, mientras que SDR y AO requieren optimizaciones iterativas para cada realización de canal.

Una etapa importante que debe realizarse correctamente para lograr el éxito es la creación de modelos de canal de campo cercano basados en los principios de propagación de ondas esféricas. El uso incorrecto de los datos de ubicación del usuario y la creación inadecuada de las características del canal afectarán negativamente el proceso de extracción de características y los resultados de formación de haces. La construcción del grafo es otro componente clave, ya que una conectividad insuficiente entre nodos dificulta la capacidad de la red neuronal gráfica (GNN) para identificar relaciones espaciales. El sobreajuste es otro problema que puede surgir cuando la red se entrena con solo unas pocas condiciones de propagación, lo que afecta el rendimiento de generalización en nuevas ubicaciones de usuarios.

Es posible implementar varias medidas para abordar problemas potenciales. Cuando la convergencia de la red neuronal es deficiente, se pueden utilizar la reducción de la tasa de aprendizaje y la regularización para solucionar el problema. La normalización de características y la esparsificación del grafo pueden prevenir inestabilidades durante el entrenamiento. Si se produce una caída inesperada en la ganancia de formación de haces, reentrenar el algoritmo con más puntos de datos puede resolver el problema.

Otra ventaja del aprendizaje profundo es la capacidad del algoritmo para adaptarse dinámicamente a las variaciones en las condiciones del canal, una tarea que ha resultado difícil para los métodos de optimización existentes. Esto aumenta la eficiencia del algoritmo de formación de haces al minimizar su tiempo de ejecución y lo hace más robusto en caso de entornos de canal dinámicos.16,18,20.

Se considera que el modelo propuesto es revolucionario para la teoría de la comunicación de campo cercano, ya que combina la modelización del canal físico con métodos de aprendizaje profundo basados en grafos. La inclusión de ondas esféricas para tener en cuenta los efectos electromagnéticos mejora la precisión del modelo; además, el uso de redes neuronales grafos (GNN) y mecanismos de atención permite describir las dependencias matemáticas entre los elementos de la metasuperficie. La combinación del aprendizaje automático con principios electromagnéticos conduce así al surgimiento de un nuevo marco teórico para la creación de entornos inalámbricos inteligentes21,27,28.

Desde una perspectiva aplicada, el enfoque desarrollado mejora significativamente la aplicabilidad de XL-IMS a despliegues prácticos de redes 6G. La reducción de la carga computacional derivada de la ausencia de un proceso de optimización permite tomar decisiones de formación de haces en tiempo real, lo cual es esencial para servicios con latencia extremadamente baja. Además, el modelo propuesto demuestra eficiencia espectral y energética, lo que hace que la tecnología sea aplicable a ciudades densas, al Internet de las Cosas y a usuarios altamente móviles.

Aunque la metodología propuesta tiene muchas fortalezas, el sistema también presenta algunas debilidades. Sin embargo, aunque DeepMIMO ofrece escenarios de propagación realistas mediante el trazado de rayos, sigue siendo un entorno de simulación, y existirán algunas discrepancias entre el comportamiento real de la propagación inalámbrica y los escenarios simulados, ya que siempre habrá cambios ambientales y dispersores desconocidos, efectos temporales en el canal, efectos climáticos y efectos de calibración del hardware que deben considerarse. Por lo tanto, sus resultados deben considerarse como una estimación del límite superior26,38. El modelo actual supone componentes perfectos para el transmisor y el receptor. En sistemas reales, el ruido de fase en los osciladores, la distorsión del amplificador, los errores del sincronizador, el ruido de cuantización de los convertidores analógico-digitales y una estimación inexacta del canal pueden provocar un rendimiento deficiente. Estos problemas podrían afectar la alineación y reducir la tasa de datos del sistema.

Existen varios problemas de implementación que aún deben abordarse antes de que las comunicaciones de campo cercano habilitadas para XL-IMS puedan implementarse a gran escala. Dichos problemas incluyen la estimación de canal en tiempo real para metasuperficies grandes, la escalabilidad del cálculo para varios miles de antenas, la sincronización en una red distribuida, los costos del equipo, los requisitos de potencia y la integración con los sistemas 6G existentes. La investigación futura debería centrarse en explorar modelos de aprendizaje ligeros y formación de haces.

El estudio presenta una arquitectura pionera de modelado de canal en campo cercano y formación de haces para IMS de gran escala en el contexto de las comunicaciones 6G. La innovación combina un modelado de canal de onda esférica inspirado en la física con redes neuronales gráficas y mecanismos de atención, logrando una representación precisa del canal en campo cercano y ganancias óptimas de formación de haces. El sistema comprende el modelado del canal en campo cercano, el diseño de conjuntos de datos basado en DeepMIMO, la representación de características, la modelización de dependencias espaciales y la optimización de la formación de haces. La evaluación experimental mostró mejores resultados que otros enfoques de última generación, como ZF, MMSE, SDR y AO, en términos de tasa alcanzable, ganancia de formación de haces, eficiencia espectral, eficiencia energética y SINR. Además, el estudio de ablación demostró la eficacia de cada componente del sistema.

Divulgaciones

Los autores no tienen conflictos de intereses.

Agradecimientos

Este trabajo fue apoyado en parte por la Fundación Nacional de Ciencias Naturales de China (número de beca 62466036) y por el Fondo de Inicio de Investigación de la Universidad GanDong (número de beca 12225000423). Los autores desean agradecer a la Universidad GanDong por proporcionar las instalaciones de investigación necesarias y el apoyo institucional. Este trabajo fue respaldado por la Escuela de Ingeniería de la Información y por el Laboratorio de Algoritmos y Aplicaciones de Inteligencia Artificial de la Universidad GanDong, Fuzhou, China.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Kit de herramientas CUDANVIDIACUDA 12.4https://developer.nvidia.com/cuda-toolkit
DGLEquipo DGLDGL 2.2.1https://www.dgl.ai
MatplotlibEquipo de desarrollo de MatplotlibMatplotlib 3.9.0https://matplotlib.org
NumPyDesarrolladores de NumPyNumPy 1.26.4https://numpy.org
PythonFundación PythonPython 3.10.13https://www.python.org
PyTorchMeta AIPyTorch 2.3.1https://pytorch.org
Geometría de PyTorchEquipo PyGPyG 2.5.3https://pytorch-geometric.readthedocs.io
SeabornDesarrolladores de SeabornSeaborn 0.13.2https://seaborn.pydata.org
TensorFlowGoogleTensorFlow 2.16.1https://www.tensorflow.org

Referencias

  1. Yang S, et al. Near-field channel estimation for extremely large-scale reconfigurable intelligent surface (XL-RIS)-aided wideband mmWave systems. IEEE J Sel Areas Commun. 2024;42:1567-82.
  2. Ni H, et al. Energy-efficient near-field beamforming: A review on practical channel models. Energies. 2025;18:2966.
  3. Di Renzo M, et al. Smart radio environments empowered by reconfigurable intelligent surfaces: How it works, state of research, and the road ahead. IEEE J Sel Areas Commun. 2020;38:2450-525.
  4. Tang W, et al. Wireless communications with reconfigurable intelligent surface: Path loss modeling and experimental measurement. IEEE Trans Wirel Commun. 2021;20:421-39.
  5. Li R, et al. Joint design of hybrid beamforming and reflection coefficients in RIS-aided mmWave MIMO systems. IEEE Trans Commun. 2022;70:2404-16.
  6. Wei L, et al. Joint channel estimation and signal recovery for RIS-empowered multiuser communications. IEEE Trans Commun. 2022;70:4640-55.
  7. Yang S, et al. Separate channel estimation with hybrid RIS-aided multi-user communications. IEEE Trans Veh Technol. 2022;72(1):1318-24.
  8. Wei L, et al. Channel estimation for RIS-empowered multi-user MISO wireless communications. IEEE Trans Commun. 2021;69:4144-57.
  9. Huang C, et al. Multi-hop RIS-empowered terahertz communications: A DRL-based hybrid beamforming design. IEEE J Sel Areas Commun. 2021;39:1663-77.
  10. Fascista A, et al. RIS-aided joint localization and synchronization with a single-antenna receiver: Beamforming design and low-complexity estimation. IEEE J Sel Top Signal Process. 2022;16:1141-56.
  11. Huang C, et al. Reconfigurable intelligent surfaces for energy efficiency in wireless communication. IEEE Trans Wirel Commun. 2019;18:4157-70.
  12. Fan W, et al. Near-field channel characterization for mid-band ELAA systems: Sounding, parameter estimation, and modeling. arXiv. 2024;arXiv:2405.06159.
  13. Hasan SR, et al. A comprehensive review on reconfigurable intelligent surface for 6G communications: Overview, deployment, control mechanism, application, challenges, and opportunities. Wirel Pers Commun. 2024;139:375-429.
  14. Cui M, et al. Near-field MIMO communications for 6G: Fundamentals, challenges, potentials, and future directions. IEEE Commun Mag. 2023;61:40-6.
  15. Zhang H, Shlezinger N, Guidi F, Dardari D, Eldar YC. 6G wireless communications: From far-field beam steering to near-field beam focusing. IEEE Commun Mag. 2023;61(4):72-7.
  16. Ning B, et al. Beamforming technologies for ultra-massive MIMO in terahertz communications. IEEE Open J Commun Soc. 2023;4:614-58.
  17. Xu B, et al. Resource allocation for near-field communications: Fundamentals, tools, and outlooks. IEEE Wirel Commun. 2024;31:42-50.
  18. Devi P, Bharti MR, Gautam D. A survey on physical layer security for 5G/6G communications over different fading channels: Approaches, challenges, and future directions. Veh Commun. 2025;53:100891.
  19. Elzanaty A, et al. Near and far field model mismatch: Implications on 6G communications, localization, and sensing. IEEE Internet Things Mag. 2024;7:120-6.
  20. Liu Y, et al. Near-field communications: A tutorial review. IEEE Open J Commun Soc. 2023;4:1999-2049.
  21. Wang Z, Mu X, Liu Y. Near-field integrated sensing and communications. IEEE Commun Lett. 2023;27:2048-52.
  22. Dai L, Tan J, Chen Z, Poor HV. Delay-phase precoding for wideband THz massive MIMO. IEEE Trans Wirel Commun. 2022;21:7271-86.
  23. Zhang H, et al. Beam focusing for near-field multiuser MIMO communications. IEEE Trans Wirel Commun. 2022;21(9):7476-90.
  24. Lu H, Zeng Y. Near-field modeling and performance analysis for multi-user extremely large-scale MIMO communication. IEEE Commun Lett. 2022;26:277-81.
  25. Zhang J, Björnson E, Matthaiou M, Ng DWK, Larsson EG. Prospective multiple antenna technologies for beyond 5G. IEEE J Sel Areas Commun. 2020;38:1637-60.
  26. Liu Y, et al. Near-field communications: A comprehensive survey. IEEE Commun Surv Tutor. 2025;27:1687-728.
  27. Liu Y, et al. Near-field communications: What will be different? IEEE Wirel Commun. 2025;32:262-70.
  28. Gong T, et al. Holographic MIMO communications: Theoretical foundations, enabling technologies, and future directions. IEEE Commun Surv Tutor. 2024;26:196-257.
  29. Lu S, et al. Integrated sensing and communications: Recent advances and ten open challenges. IEEE Internet Things J. 2024;11:19094-120.
  30. Yan W, et al. Beamforming analysis and design for wideband THz reconfigurable intelligent surface communications. IEEE J Sel Areas Commun. 2023;41:2306-20.
  31. Hao W, et al. Ultra-wideband THz IRS communications: Applications, challenges, key techniques, and research opportunities. IEEE Netw. 2022;36:214-20.
  32. Sun H, et al. Time-delay unit-based beam squint mitigation for RIS-aided communications. IEEE Commun Lett. 2022;26:2220-4.
  33. Cui M, Dai L. Near-field wideband beamforming for extremely large antenna arrays. IEEE Trans Wirel Commun. 2024;23(10):13110-24.
  34. Wang Z, et al. TTD configurations for near-field beamforming: Parallel, serial, or hybrid? IEEE Trans Commun. 2024;72:3783-99.
  35. Xu J, et al. Near-field wideband extremely large-scale MIMO transmission with holographic metasurface antennas. arXiv. 2022;arXiv:2205.02533.
  36. Nordio A, et al. Near-field IRS configuration techniques for wideband signals and THz communications. In: Proc IEEE Int Conf Commun Workshops (ICC Workshops); 2023. p. 1198-203.
  37. Huang C, Zappone A, Alexandropoulos GC, Debbah M, Yuen C. Holographic MIMO surfaces for 6G wireless networks: Opportunities, challenges, and trends. IEEE Wirel Commun. 2020;27:118-25.
  38. Monemi M, et al. 6G Fresnel spot beamfocusing using large-scale metasurfaces: A distributed DRL-based approach. IEEE Trans Mob Comput. 2024;23:11670-84.
  39. Zhu F, et al. Robust beamforming for RIS-aided communications: Gradient-based manifold meta learning. IEEE Trans Wirel Commun. 2024;23(11):15945-56.
  40. Wang X, et al. Energy-efficient beamforming for RISs-aided communications: Gradient based meta learning. In: Proc IEEE Int Conf Commun (ICC); 2024. p. 1-6.

Reimpresiones y permisos

Etiquetas

Optimizaci n del conformado de hacesredes neuronales gr ficasmecanismo de atenci nmarco de aprendizaje profundopropagaci n de ondas esf ricasmetasuperficies inteligentes extremadamente grandeseficiencia espectraleficiencia energ tica