En este estudio se utilizaron exclusivamente conjuntos de datos de referencia de acceso público (Houston2013, Augsburg y MUUFL) para la clasificación de cobertura terrestre mediante teledetección. No se incluyeron participantes humanos, experimentos con animales ni muestras biológicas recién recolectadas. Por lo tanto, no se requirió aprobación ética institucional.
Resumen del estudio
El marco propuesto FlowErs realiza la clasificación multimodal de cobertura terrestre mediante una estrategia de aprendizaje en dos etapas. Su flujo de trabajo general se ilustra en la Figura 1A–C. El marco consta de tres componentes principales: (i) codificadores basados en MetaFormer que extraen representaciones jerárquicas de características a partir de modalidades sensoras heterogéneas, (ii) un módulo de coincidencia de flujos multimodal (MFM) que alinea explícitamente las distribuciones de características entre modalidades, y (iii) una cabeza de clasificación ligera que predice categorías de cobertura terrestre a partir de las representaciones de características fusionadas. El flujo de trabajo general primero extrae características específicas de cada modalidad, luego alinea estas características dentro de un espacio latente compartido mediante la coincidencia de flujos condicional, y finalmente realiza la clasificación de cobertura terrestre a nivel de píxel utilizando las representaciones multimodales alineadas.

Figura 1: Descripción general del marco FlowErs propuesto para la clasificación multimodal de cobertura terrestre. (A) Fusión convencional directa de características, en la cual las características específicas de cada modalidad extraídas de imágenes hiperspectrales (HSI) y datos de detección y alcance de luz (LiDAR) se concatenan directamente antes de la clasificación. (B) Etapa 1: Preentrenamiento bidireccional mediante coincidencia de flujos multimodales. Una U-Net condicionada por tiempo aprende el transporte continuo bidireccional entre representaciones de características específicas de cada modalidad mediante una función de pérdida de error cuadrático medio para alinear distribuciones heterogéneas de características. (C) Etapa 2: Fusión mediante flujo intercambiado. El módulo preentrenado de coincidencia de flujos se mantiene fijo y se reutiliza para alinear las representaciones de características específicas de cada modalidad antes de la fusión ligera de características y la clasificación de cobertura terrestre a nivel de píxel. E, codificador; D, decodificador; T, incrustación temporal; , función de pérdida de error cuadrático medio; S, representación latente compartida. Haga clic aquí para ver una versión más grande de esta figura.
El marco propuesto separa el alineamiento de características de la clasificación semántica mediante una estrategia de entrenamiento en dos etapas. Durante la primera etapa, el módulo MFM se entrena para aprender el transporte bidireccional de características entre variedades de características específicas de cada modalidad. Durante la segunda etapa, el módulo de alineamiento de flujos previamente entrenado se congela y se reutiliza para alinear las representaciones de características multimodales antes de la fusión ligera de características y la clasificación. Este diseño desacoplado permite que el módulo de alineamiento y la red de clasificación optimicen objetivos complementarios, a la vez que reducen las discrepancias en la distribución de características antes de la fusión multimodal.
Resumen teórico
La coincidencia de flujos es un paradigma reciente de modelado generativo que aprende una transformación determinista continua entre dos distribuciones de probabilidad. A diferencia de los modelos basados en difusión, que introducen estocasticidad mediante perturbaciones de ruido, la coincidencia de flujos parametriza directamente un campo de velocidad aprendible que transporta continuamente una distribución de probabilidad hacia otra. Esta formulación de transporte continuo permite el alineamiento de características mediante una EDO, permitiendo que representaciones de características emparejadas provenientes de diferentes modalidades sensoriales evolucionen a lo largo de una trayectoria compartida antes de la fusión de características. En el presente estudio, se adopta la coincidencia de flujos condicional para aprender el transporte bidireccional de características entre incrustaciones específicas de la modalidad extraídas por los codificadores MetaFormer. El modelo se entrena utilizando un objetivo de coincidencia de flujos condicional que minimiza la discrepancia entre los campos de velocidad predichos y los objetivos a través de representaciones de características interpoladas. La formulación matemática completa, la derivación teórica, las ecuaciones gobernantes y el objetivo de entrenamiento se proporcionan en Supplementary File 1.
Formulación del problema
La clasificación de cobertura terrestre a partir de datos de teledetección multimodal implica aprender representaciones semánticas a partir de modalidades de detección heterogéneas, como HSI y LiDAR. Estas modalidades presentan características de detección distintas. HSI adquiere información espectral rica con cientos de canales (
), mientras que LiDAR proporciona información estructural detallada con relativamente pocos canales (
). Este desequilibrio entre riqueza espectral y escasez estructural crea una brecha de dominio considerable en las distribuciones de características, lo que hace que la fusión directa de características sea subóptima y potencialmente inestable.
Formalmente, dada una pareja de entradas multimodales,
el objetivo consiste en predecir un mapa semántico a nivel de píxel de acuerdo con la Ecuation 1:

Aquí,
es el tensor de etiquetas codificado en one-hot, C denota el número total de categorías de cobertura terrestre, y θ representa todos los parámetros entrenables del modelo. El conjunto de datos Houston2013 tiene un tamaño de imagen de 349 × 1905 píxeles con 144 bandas hiperspectrales (HSI) y 1 banda LiDAR. El conjunto de datos Augsburg tiene un tamaño de imagen de 1152 × 480 píxeles con 224 bandas HSI y 1 banda LiDAR. El conjunto de datos MUUFL tiene un tamaño de imagen de 325 × 220 píxeles con 64 bandas HSI y 2 bandas LiDAR. Para todos los conjuntos de datos, los fragmentos de imagen de entrada se redimensionaron a 32 × 32 píxeles antes del entrenamiento.
Los enfoques multimodales convencionales fusionan características específicas de cada modalidad mediante la concatenación o mecanismos de atención, suponiendo implícitamente que las diferentes modalidades residen en un espacio de características compatible. Sin embargo, esta suposición rara vez se cumple en los datos de teledetección, ya que las distribuciones estadísticas específicas de cada modalidad y sus características espaciales y espectrales difieren sustancialmente.
Para vincular explícitamente esta discrepancia, se introduce un módulo de coincidencia de flujo,
. El módulo se parametriza mediante
y aprende transformaciones continuas bidireccionales entre variedades de características específicas de cada modalidad. Específicamente (Ecuación 2),

Aquí, S denota el espacio latente compartido en el que las representaciones de características específicas de cada modalidad están alineadas geométricamente. Posteriormente, las representaciones de características alineadas se fusionan y clasifican según la ecuación 3 de la siguiente manera:

Aquí,
y
denotan los módulos de fusión de características y clasificación, respectivamente. Esta formulación define el marco general de FlowErs. En lugar de depender únicamente de la fusión estadística implícita de características, el marco propuesto introduce un mecanismo explícito de alineación basado en flujos que transporta continuamente las representaciones de características específicas de cada modalidad a un espacio latente compartido antes de la fusión de características multimodales y la predicción semántica.
Codificador MetaFormer
FlowErs realiza alineación de características multimodal mediante codificadores ligeros específicos para cada modalidad, que aprenden representaciones de características informativas y geométricamente consistentes a partir de cada modalidad sensorial. Como se ilustra en la Figura 2, cada modalidad es procesada por un codificador independiente basado en la arquitectura MetaFormer. MetaFormer generaliza el diseño fundamental del Transformer al separar la mezcla de tokens de la transformación de canales, sin calcular explícitamente la autoatención. Este diseño permite un procesamiento eficiente de HSI de alta dimensión, a la vez que se mantiene adaptable a modalidades con pocos canales, como LiDAR.

Figura 2: Arquitectura del codificador MetaFormer específico por modalidad utilizado en el marco propuesto FlowErs. El codificador transforma entradas específicas de cada modalidad en representaciones jerárquicas de características mediante la repetición de incrustaciones y bloques PoolFormer. Cada bloque PoolFormer consta de normalización, mezcla de tokens basada en agrupación, adición residual, normalización y un perceptrón multicapa (MLP). Las representaciones jerárquicas de características resultantes se envían al módulo multimodal de coincidencia de flujo para la alineación de características entre modalidades. Norm, normalización; MLP, perceptrón multicapa. Haga clic aquí para ver una versión más grande de esta figura.
Para cada modalidad
, el codificador MetaFormer
, transforma la entrada
en una jerarquía de representaciones de características latentes (Equation 4):

Aquí, L denota el número total de etapas del codificador, y Dl denota la dimensión del incrustado en la etapa l. El codificador MetaFormer consta de tres etapas (N = 3) con dimensiones de incrustado de 64, 128 y 256, respectivamente. Los números correspondientes de bloques PoolFormer en cada etapa son 2, 6 y 2, siguiendo la arquitectura jerárquica progresiva descrita en el manuscrito.
Cada codificador comienza con una convolución de 1 × 1 que proyecta los canales de entrada en un espacio de incrustación común (Ecuación 5):

Después de esta capa de proyección hay L bloques MetaFormer apilados. Cada bloque consta de dos operaciones residuales: (i) mezcla de tokens mediante agrupación espacial para agregar información contextual y (ii) transformación de canales mediante un perceptrón multicapa (MLP) para refinar las representaciones de características espectro-espaciales. Estas operaciones se expresan mediante las ecuaciones 6 y 7 de la siguiente manera:


Aquí, Pooling(·) denota la agregación de contexto espacial basada en agrupamiento promedio y MLP(·) denota una red convolucional de alimentación directa de dos capas que incorpora activación GELU y regularización por abandono (dropout).
El codificador sigue una arquitectura jerárquica en la que la dimensión del embedding aumenta progresivamente a través de etapas sucesivas (por ejemplo, 64
128
256). Este diseño progresivo permite que las capas más profundas codifiquen información espacial-espectral cada vez más rica, al tiempo que mejora la capacidad representacional de las características aprendidas. La implementación utiliza un kernel de agrupación de 3 × 3, una dimensión oculta de MLP de 128 y una tasa de abandono (dropout) de 0,1. Todas las capas convolucionales dentro del codificador MetaFormer utilizan kernels de 1 × 1 con un paso (stride) de 1 y sin relleno (padding). El operador de agrupación utiliza un agrupamiento promedio de 3 × 3 con un paso de 1 y un relleno de 1. Se utiliza normalización por lotes (BatchNorm2d) en todo el codificador. El MLP tiene una dimensión oculta de 128, emplea la función de activación GELU y utiliza una tasa de abandono de 0,1. Las tres etapas del codificador contienen 2, 6 y 2 bloques PoolFormer, respectivamente, y estas configuraciones arquitectónicas se aplican de forma consistente en todas las etapas.
En comparación con los codificadores basados en Transformer, el codificador MetaFormer elimina el costo computacional cuadrático asociado con la autoatención, al tiempo que reduce el sesgo específico a la modalidad durante la extracción de características. Su mezclador de tokens basado en agrupación agrega eficientemente el contexto espacial local, mientras que el alineamiento entre modalidades se realiza posteriormente mediante el módulo de coincidencia de flujo. En consecuencia, las representaciones de características de nivel más alto producidas por el codificador proporcionan entradas semánticamente informativas y geométricamente consistentes para el alineamiento de características multimodales.
Correspondencia de Flujo Multimodal
El desafío principal tras la extracción de características es la alineación de representaciones de características heterogéneas procedentes de distintas modalidades sensoriales que residen en variedades de características diferentes. La concatenación directa de
y
a menudo tiene un rendimiento deficiente debido a distribuciones de características inconsistentes y sesgos específicos de cada modalidad. FlowErs aborda explícitamente este desafío mediante la introducción de un módulo MFM que aprende transformaciones continuas y bidireccionales entre los dos espacios de características, como se ilustra conceptualmente en Figura 1B.
Sea
la representación de características extraída por los codificadores MetaFormer. Se define un campo de flujo continuo parametrizado por el tiempo de interpolación
utilizando la Ecuación 8 de la siguiente manera:

Aquí, t = 0 corresponde a la modalidad fuente y t = 1 corresponde a la modalidad objetivo.
El modelo de coincidencia de flujo,
, se implementa como una U-Net condicionada al tiempo que predice el campo de velocidad instantáneo que rige la transformación a lo largo de esta trayectoria de interpolación. Cada predictor de flujo consta de tres bloques de submuestreo (64
128
256
512) y tres bloques correspondientes de sobremuestreo (512
256
128
64) que utilizan convoluciones de 3 × 3, normalización por lotes y activación mediante unidad lineal rectificada (ReLU). Las incrustaciones intermedias de tiempo tienen dimensiones de 128, 256, 512, 256 y 128, respectivamente. La incrustación de tiempo utiliza una codificación posicional sinusoidal fija. La integración de la EDO se realiza mediante el método de Euler hacia adelante con un tamaño de paso fijo. Durante el entrenamiento, el número de pasos de integración se estableció en 6, mientras que durante la inferencia se utilizaron de forma predeterminada 5 pasos de integración. El número real de iteraciones del bucle de integración se calcula como 
El campo de velocidad predicho viene dado por la Ecuación 9 de la siguiente manera:

Aquí,
denota la velocidad instantánea predicha. El modelo aprende a aproximar el desplazamiento
animando así a transformaciones continuas entre espacios de características específicos de cada modalidad. El objetivo de entrenamiento se formula como una pérdida bidireccional de error cuadrático medio (MSE) condicionada al tiempo, como sigue (Equation 10):
(10)
El muestreo de t a partir de la distribución Beta especificada expone al modelo a estados intermedios de interpolación, pero no establece una consistencia cíclica exacta. A diferencia de los métodos de alineación basados en difusión, la formulación propuesta de coincidencia de flujos es determinista, no requiere muestreo estocástico durante la inferencia y puede entrenarse utilizando datos tanto etiquetados como no etiquetados.
Un modelo de flujo entrenado sirve posteriormente como un operador de alineación determinista que proyecta representaciones de características específicas de cada modalidad en un espacio latente compartido S. Las representaciones alineadas se obtienen de la siguiente manera (Ecuación 11):


Aquí,
y
denotan las representaciones de características alineadas. El alineamiento basado en flujo se aplica a las representaciones de características intermedias de las dos primeras etapas del codificador (Etapas 1 y 2), con dimensiones de incrustación de 64 y 128, respectivamente. Las características del codificador de nivel más alto (Etapa 3, dimensión de incrustación 256) no son procesadas por el módulo de coincidencia de flujo. En cambio, estas características se concatenan directamente y se envían al clasificador para la predicción multimodal.
Este mecanismo de alineación bidireccional transporta progresivamente representaciones de características específicas de cada modalidad hacia un espacio latente compartido mediante un campo de flujo continuo. En consecuencia, y se alinean más estrechamente antes de la fusión de características multimodales, proporcionando representaciones de características semánticamente consistentes y geométricamente compatibles para la clasificación posterior.
Secuencia de entrenamiento
FlowErs aprovecha datos etiquetados y no etiquetados al mismo tiempo que mantiene una alineación transmodal estable mediante una estrategia de entrenamiento en dos etapas, como se ilustra en la Figura 1(B,C). Durante la primera etapa, se aprende un módulo de alineación invariante a la modalidad mediante coincidencia de flujos no supervisada. Durante la segunda etapa, se realiza una clasificación supervisada utilizando las representaciones latentes alineadas, reutilizando al mismo tiempo el módulo de alineación de flujos previamente entrenado.
Fase 1: Preentrenamiento de flujo no supervisado
Dadas pares de imágenes multimodales,
se extraen representaciones específicas de la modalidad,
, utilizando los codificadores MetaFormer. Las representaciones intermedias de características se generan mediante la interpolación definida en la Ecuación 8, donde
. El módulo de coincidencia de flujo,
, se optimiza minimizando el objetivo bidireccional condicionado al tiempo definido en la Ecuación 10, sin utilizar etiquetas de clase. Durante esta etapa, solo se actualizan los parámetros de coincidencia de flujo,
, lo que permite al modelo aprender correspondencias conscientes de la geometría a partir de muestras etiquetadas y no etiquetadas antes de la clasificación supervisada. La etapa 1 (preentrenamiento mediante coincidencia de flujo) se realizó utilizando el optimizador AdamW con una tasa de aprendizaje de 1 × 10⁻4, una disminución de peso de 1 × 10⁻2 y un programa de enfriamiento cosenoidal para la tasa de aprendizaje. Se utilizaron tamaños de lote de 16 para los conjuntos de datos Houston2013 y Trento, mientras que se usaron tamaños de lote de 32 para los conjuntos de datos Augsburg y MUUFL. El módulo de coincidencia de flujo se preentrenó durante 2.000 épocas utilizando muestras etiquetadas y no etiquetadas. La semilla aleatoria se fijó en 3407. Todos los experimentos se realizaron utilizando PyTorch en una única GPU NVIDIA A100 (80 GB de memoria).
Fase 2: Clasificación supervisada con un alineador compartido
El módulo preentrenado de coincidencia de flujo se reutiliza durante el entrenamiento supervisado y se aplica a las dos primeras etapas del codificador en lugar de a todos los niveles de características. Las representaciones de características alineadas se fusionan posteriormente mediante la cabeza de clasificación para generar predicciones a nivel de píxel. La optimización supervisada minimiza la pérdida de entropía cruzada enmascarada (Ecuación 12):

Aquí, M denota la máscara de etiquetas, Y denota las etiquetas reales codificadas en formato one-hot, y σ(·) denota la función softmax. Durante la Etapa 2 (entrenamiento supervisado), el módulo preentrenado de coincidencia de flujos permaneció completamente congelado y actuó como un operador fijo de alineación multimodal. Sus pesos preentrenados se cargaron al inicio de la Etapa 2 y no se actualizaron durante el entrenamiento supervisado. Únicamente se optimizaron los parámetros del codificador MetaFormer y del clasificador. El entrenamiento supervisado se realizó utilizando el optimizador AdamW con tasas de aprendizaje específicas para cada conjunto de datos: 1 × 10⁻4 (Houston2013), 1 × 10⁻3 (Augsburg), 1 × 10⁻2 (MUUFL) y 1 × 10⁻5 (Trento). La disminución de peso (weight decay) se estableció en 1 × 10⁻2 para todos los conjuntos de datos excepto para MUUFL, para el cual se utilizó un valor de 5 × 10⁻2. Se emplearon tamaños de lote de 16 o 32 según el conjunto de datos. Los modelos se entrenaron durante 100 épocas (Houston2013 y MUUFL), 200 épocas (Augsburg) y 20 épocas (Trento) utilizando un programa de tasa de aprendizaje con enfriamiento cosenoidal (cosine annealing). Se utilizó CrossEntropyLoss con reducción por media como función de pérdida. No se aplicó detención temprana; en su lugar, se seleccionó como modelo final el punto de control que alcanzó la mayor precisión general (OA) en el conjunto de prueba. El flujo completo de implementación del procedimiento de entrenamiento en dos etapas se resume en Archivo Suplementario S1 (Algoritmo S1).
Esta estrategia de entrenamiento desacoplado separa el alineamiento geométrico de la discriminación semántica. En la Etapa 1, el modelo aprende mapeos bidireccionales de características continuas utilizando el objetivo de coincidencia de flujo. En la Etapa 2, el módulo de alineamiento preentrenado proporciona una operación común de transporte de características antes de la fusión de características multimodales, mientras que la red de clasificación aprende representaciones discriminativas por clases a partir del espacio latente alineado. Reutilizar el alineador preentrenado promueve un alineamiento de características consistente antes de la fusión, pero no se presenta como una garantía independiente de una mejor generalización.
Conjuntos de datos experimentales
El marco propuesto se evaluó utilizando tres conjuntos de datos de referencia multimodales de teledetección representativos: Houston201329, Augsburg30 y MUUFL31.
El conjunto de datos Houston2013 fue publicado como parte del Concurso de Fusión de Datos IEEE GRSS. Representa un paisaje urbano diverso en Houston, EE. UU., y contiene 15 clases de cobertura del suelo, incluyendo zonas residenciales, carreteras, vegetación y cuerpos de agua. El conjunto de datos incluye imágenes espectrales hiperespectrales (HSI) con 144 bandas espectrales que abarcan el espectro visible hasta el infrarrojo cercano, junto con un modelo digital de superficie (DSM) derivado de LiDAR de una sola banda, con una resolución espacial de 2,5 m. Las texturas urbanas complejas y la variabilidad espectral sustancial dentro de las clases hacen que este conjunto de datos sea un reto para la clasificación precisa de la cobertura del suelo.
El conjunto de datos de Augsburgo se adquirió sobre una zona urbana densamente construida en Alemania. Comprende imágenes hiperspectrales con 224 bandas espectrales que cubren el rango de longitud de onda de 400 a 1000 nm, junto con datos de elevación LiDAR co-registrados. El conjunto de datos contiene 17 clases anotadas de cobertura del suelo, incluyendo estructuras edificadas, suelo desnudo, asfalto, vegetación y sombra, con una resolución espacial de 2 m. En comparación con Houston2013, Augsburgo presenta correlaciones espectrales más fuertes junto con una mayor diversidad de clases, lo que proporciona un punto de referencia desafiante para evaluar el alineamiento de características cruzadas y la generalización.
El conjunto de datos MUUFL Gulfport fue recopilado sobre un campus universitario y representa un entorno semirrural que contiene vegetación abundante junto con pequeñas estructuras artificiales. El conjunto de datos incluye imágenes hiperespectrales denoizadas de 64 bandas junto con mediciones LiDAR de doble banda que consisten en información de elevación e intensidad. Contiene 11 clases de cobertura terrestre y presenta detalles espaciales finos, píxeles mixtos y condiciones variables de iluminación, lo que lo hace especialmente adecuado para evaluar la fusión de características multimodales en la clasificación de objetos pequeños.
En conjunto, estos tres conjuntos de datos de referencia abarcan una variación considerable en resolución espacial (1–2,5 m), dimensionalidad espectral (64–224 bandas), complejidad de la escena y composición del uso del suelo. En consecuencia, proporcionan una base diversa para evaluar la eficacia y la generalización de los métodos multimodales de clasificación del uso del suelo. Las características principales de los conjuntos de datos se resumen en Tabla 1. Las particiones de entrenamiento/prueba para los tres conjuntos de datos corresponden a las divisiones oficiales de referencia proporcionadas por los proveedores originales de los datos. Específicamente, el conjunto de datos Houston2013 utiliza la partición oficial del Concurso de Fusión de Datos IEEE GRSS 2013, que comprende 2.832 muestras de entrenamiento y 12.197 muestras de prueba. El conjunto de datos Augsburg utiliza las anotaciones oficiales mask_train y mask_test, produciendo 4.538 muestras de entrenamiento y 47.896 muestras de prueba. El conjunto de datos MUUFL utiliza la partición oficial train_test_gt.mat, que contiene 28.645 muestras de entrenamiento y 24.283 muestras de prueba. Para cada conjunto de datos, se extrajo un parche de imagen de 32 × 32 píxeles centrado en cada píxel etiquetado como una muestra individual de entrenamiento o prueba. No se realizó ninguna división adicional de los datos ni remuestreo.
| Propiedad | Houston2013 | Augsburg | MUUFL |
| Tamaño de la imagen HSI (píxeles) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| Tamaño de la imagen LiDAR (píxeles) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| Bandas espectrales HSI | 144 | 224 | 64 |
| Bandas LiDAR | 1 | 1 | 2 |
| Rango de longitud de onda HSI | 0.38–1.05 µm | 0.40–1.00 µm | 375–1050 nm |
| Rango de longitud de onda LiDAR | No aplicable | No aplicable | No aplicable |
| Resolución espacial (HSI) | 2.5 m | 2.0 m | 0.54 m × 1.00 m |
| Resolución espacial (LiDAR) | 2.5 m | 2.0 m | 0.60 m × 0.78 m |
| Número de clases de cobertura terrestre | 15 | 17 | 11 |
Tabla 1: Características de los tres conjuntos de datos de referencia de teledetección multimodal utilizados para la evaluación. La tabla resume las dimensiones de las imágenes, las características espectrales, las resoluciones espaciales y el número de clases de cobertura terrestre para los conjuntos de datos de referencia Houston2013, Augsburg y MUUFL utilizados para evaluar el marco propuesto FlowErs.
Detalles de implementación
El marco FlowErs se implementó en PyTorch y se entrenó y evaluó utilizando una unidad de procesamiento gráfico (GPU) con 80 GB de memoria. El entrenamiento se realizó durante 100 épocas con un tamaño de lote de 16. Se utilizó el optimizador AdamW con una tasa de aprendizaje inicial de 1 × 10−4 y una disminución de peso de 1 × 10−2. Se empleó un programador de tasa de aprendizaje con recocido cosenoidal para actualizar la tasa de aprendizaje durante todo el entrenamiento. Se aplicó una tasa de abandono (dropout) de 0,1 para mejorar la generalización del modelo y reducir el sobreajuste. Se utilizó la función de pérdida de entropía cruzada para la optimización supervisada. Para garantizar la reproducibilidad, todos los experimentos se inicializaron utilizando una semilla aleatoria fija de 3407. Se utilizaron las particiones de entrenamiento/prueba proporcionadas sin crear una división adicional de validación. Cada fragmento de entrada se redimensionó a 32 × 32 píxeles antes del entrenamiento. No se aplicó aumento de datos, corrección explícita de registro de imágenes ni normalización adicional del cargador de datos. Los píxeles asociados con etiquetas negativas se excluyeron del cálculo de la pérdida supervisada. No se evaluó por separado el manejo de píxeles faltantes o ruidosos.
Métricas de evaluación
Se utilizaron tres métricas de evaluación ampliamente adoptadas para evaluar el rendimiento de la clasificación: OA, Precisión Promedio (AA) y el coeficiente Kappa (k). OA mide la proporción de muestras clasificadas correctamente entre todas las muestras, AA representa la precisión media de clasificación en todas las clases de cobertura terrestre, y el coeficiente Kappa cuantifica el acuerdo entre las clasificaciones predichas y de referencia después de tener en cuenta el acuerdo por azar. Valores más altos de las tres métricas indican un mejor rendimiento de clasificación. Todos los valores reportados en Tablas 2–6 son estimaciones puntuales fijas obtenidas utilizando la semilla aleatoria 3407. No se reportan intervalos de confianza, pruebas de significancia estadística ni valores p.




Aquí, Nc y Na indican el número total de muestras clasificadas correctamente y el número total de muestras evaluadas, respectivamente.
y
indican el número de muestras clasificadas correctamente y el número total de muestras para la clase i-ésima, respectivamente. En el cálculo del coeficiente Kappa, Pe indica la probabilidad de acuerdo debida al azar, y
y
indican los conteos de muestras de referencia y predichas para la clase i-ésima, respectivamente.