本研究提出了一种用于高光谱与激光雷达土地覆盖分类的两阶段框架,该框架在融合前采用MetaFormer特征提取与双向流匹配实现跨模态对齐。在三个公开基准数据集上的评估结果表明,该方法在固定基准协议下具有竞争力的分类性能。
本研究提出了一种用于高光谱与激光雷达土地覆盖分类的两阶段框架,该框架在融合前采用MetaFormer特征提取与双向流匹配实现跨模态对齐。在三个公开基准数据集上的评估结果表明,该方法在固定基准协议下具有竞争力的分类性能。
多模态遥感分类在城市制图和环境监测等应用中具有重要作用。然而,不同传感模态之间的异质性特征分布可能导致特征错位和语义不一致,从而限制多模态融合的有效性。现有的多模态融合方法,包括卷积方法、基于图的方法、基于注意力的方法、对比学习方法、基于传输的方法以及基于序列的方法,虽能利用互补信息,但在充分对齐模态特异性特征分布方面可能存在不足。本研究提出FlowErs,一种两阶段多模态分类框架,通过多模态流匹配来应对这一挑战。其工作假设是:在特征融合之前减少成对特征分布的差异,可在固定基准协议下提升土地覆盖分类性能。在第一阶段,模态特异的MetaFormer编码器从高光谱成像(HSI)和激光雷达(LiDAR)数据中提取分层表示。随后,一个多模态流匹配模块通过双向均方误差目标函数,学习时间条件下的速度场,将成对的特征分布传输至共享的潜在表示空间。在第二阶段,预训练的对齐模块被复用以对齐多模态表示,随后由一个轻量级融合头执行像素级分类。在三个公开基准数据集上的评估结果表明,在固定划分的基准设置下,整体精度(OA)最高达到97.56%。不同土地覆盖类别间的性能存在差异,本文讨论了类别特异性局限性以及类别不平衡对聚合指标的影响。当前评估仅限于固定划分实验,未进行重复运行的统计分析或计算性能分析。未来工作将探究统计鲁棒性、计算效率以及跨区域泛化能力。
利用遥感影像进行精确的土地利用与土地覆盖(LULC)分类,对于城市规划、环境监测、灾害管理以及可持续发展等众多实际应用至关重要1。近年来,多模态遥感数据(包括高光谱影像(HSI)、激光雷达(LiDAR)和合成孔径雷达(SAR))的可获取性显著提高,极大地拓展了遥感在细粒度土地覆盖分类方面的能力2。这些传感模态能够捕捉地球表面不同但互补的特征:高光谱影像提供丰富的光谱信息,用于表征地物成分;而激光雷达则提供精确的结构和高程信息3。融合这些异质数据源,相较于单一模态,能够生成更具判别性、抗噪能力更强且语义更全面的特征表示4。
然而,多模态数据的有效利用仍然是一个长期存在的挑战5。主要难点源于感知模态的固有异质性,这些模态在空间分辨率、噪声特性、统计分布以及特征语义方面存在差异6。例如,相同的地表覆盖对象在高光谱图像(HSI)中可能表现为高维光谱特征,而在激光雷达(LiDAR)中则表现为稀疏的几何结构7。因此,模态特有的特征通常位于不同的特征流形中,使得直接的特征融合效率低下,甚至可能产生误导。此外,许多现有的多模态融合方法,包括基于卷积、注意力机制和Transformer的方法,都隐含地假设从不同传感器提取的特征已经实现了空间和语义上的对齐8。然而,这一假设在实际应用中往往并不成立。简单的特征拼接或逐像素融合无法充分捕捉跨模态的差异,可能导致优化过程不稳定以及泛化性能下降。此外,尽管基于注意力机制的融合方法增强了特征交互,但其对大规模或高分辨率地表覆盖分类所需的长距离跨模态依赖关系的建模能力可能有限9。因此,异构特征表示的有效对齐在多模态遥感中仍是一个重大挑战,因为不兼容的嵌入表示会限制互补信息的整合。
为应对这一挑战,跨模态对齐被建模为条件特征传输问题。流匹配(flow matching)提供了一个具有数学基础的框架,用于学习异构特征分布之间连续且可逆的映射10。它通过由常微分方程(ODE)参数化的时间依赖性速度场,将一个分布向另一个分布进行传输,从而促进特征流形之间的连续变换11。与依赖随机噪声扰动或通过对抗训练实现隐式分布匹配的扩散模型不同,流匹配学习的是结构化特征空间之间的确定性双射变换12。这些特性使流匹配非常适用于多模态遥感场景,其中高光谱成像(HSI)、激光雷达(LiDAR)和合成孔径雷达(SAR)各自代表了高维特征流形,能够捕捉地球表面互补的物理属性13。因此,流匹配为通过连续特征传输建立跨模态对应关系提供了理论依据,同时在特征对齐过程中保持几何一致性。在适当的正则性假设下,ODE 流可以提供可逆映射;然而,在本研究中并未对精确的可逆性和物理可解释性进行实证评估。本研究的工作假设是:在特征融合之前减少配对特征分布之间的差异,能够在固定的基准划分下提升综合土地覆盖分类性能。
基于上述考虑,所提出的框架FlowErs在两阶段架构中引入了基于流的对齐阶段。在第一阶段,一个双向流网络被训练以对齐各模态的特征流形。具体而言,模态特定的MetaFormer主干网络提取分层特征嵌入,并通过优化流匹配目标,实现样本在模态特定特征分布之间的迁移。该过程在特征空间之间提供了平滑且可逆的变换,促使属于同一语义类别的表示在共享的潜在域中更加紧密地对齐。在第二阶段,预训练的流对齐模块被冻结,新的多模态输入在经轻量级分类器融合前被转换。这种解耦的训练策略将几何对齐与语义分类分离,使两个阶段能够优化互补的目标。对齐模块旨在特征融合前减少特征分布差异,但并未声明具备体积保持的保证。此外,FlowErs为多模态融合提供了显式的特征迁移公式,尽管本研究未单独评估其对配准误差的鲁棒性。
本研究的主要贡献总结如下。本文提出了一种名为FlowErs的两阶段框架,用于多模态土地覆盖分类。在所提出的框架中,首先使用MetaFormer编码器提取模态特异性特征,随后通过基于流的模块在轻量级特征融合之前对特征进行对齐。这种解耦设计在支持高效优化的同时,保持了对不同感知模态的灵活性。此外,本研究探讨了条件流匹配作为一种特征传输机制,用于多模态遥感中的成对跨模态特征对齐。该双向流模块在特征融合之前,为成对的特征表示预测相反的速度目标,从而在多模态融合之前提供明确的对齐策略。进一步地,所提出的框架在三个公开的基准数据集上进行了评估,在给定的固定基准划分下,最高整体精度(OA)达到97.56%。本文还明确记录了类别层面的局限性以及当前评估的范围。
近年来,流匹配(flow matching)领域的进展已将其确立为一种强大的生成建模框架,能够统一扩散模型、基于能量的模型以及基于传输的模型。与扩散模型中模拟随机轨迹的方法不同,流匹配学习一个确定性的常微分方程(ODE),通过可学习的速度场将一个简单的先验分布(例如高斯噪声)传输至目标数据分布15。该方法将得分估计与密度演化直接关联,从而产生更平滑的概率轨迹,并实现更稳定的训练动态。流匹配的一个关键优势在于其确定性与计算高效性。修正流模型(rectified flow models)16 进一步将传输路径简化为近乎直线的轨迹,提升了数值稳定性,并能在较少积分步数的情况下实现高质量样本生成。后续研究(包括一致性模型17)将受扩散模型启发的目标函数融入紧凑的基于流的框架中,以实现可比甚至更优的样本质量,同时保持高效的推理能力。此外,基于流的训练可利用预训练的扩散模型主干网络,从而便于使用大规模生成先验,同时降低采样成本。近期研究已将流匹配拓展至广泛的应用领域。例如,Hu 等人18 探索了使用流匹配进行可控且可组合的图像编辑时的 Transformer 主干网络与潜在空间操作。其他应用还包括图像合成19、轴承故障诊断20 以及多目标、多焊缝机器人焊接21。总体而言,这些研究证明流匹配不仅适用于高分辨率和条件图像合成,还具备坚实的理论基础,具有跨领域泛化的潜力。通过学习连续且确定性的传输映射,流匹配在效率、可控性与生成保真度之间实现了良好平衡。其基于常微分方程的表述为现代生成建模提供了统一的视角,并为涉及多模态数据表示与特征对齐的应用奠定了理论基础。
多模态遥感分类旨在通过融合高光谱成像(HSI)、多光谱影像、激光雷达(LiDAR)和合成孔径雷达(SAR)的互补信息,克服单一传感模态的局限性。早期的融合方法依赖于手工设计特征或基于核的算法,例如支持向量机(SVMs),但受限于高维度和跨模态交互不足22。深度学习的发展推动了结构化融合策略的进步,包括早期融合、中期融合和晚期融合,其中特征级融合在信息整合与计算复杂度之间提供了实用的平衡23。卷积神经网络(CNNs)能有效捕捉局部空间-光谱信息,而基于Transformer的架构则以更高的计算代价建模长距离依赖关系24。因此,结合两者优势的CNN–Transformer混合架构日益流行。代表性方法包括通过跨尺度交互增强上下文信息的邻近尺度融合方法25,以及利用自适应注意力机制将浅层CNN特征与深层Transformer表征相结合的多层级框架26。总体而言,这些研究突显了有效的跨尺度与跨模态交互在减少特征冗余和提升语义表征能力方面的重要性。
近期研究还探索了多模态学习的互补策略。例如,低秩表示方法(如受艾宾浩斯曲线引导的框架)通过保留流形结构的同时抑制冗余信息,从而减少过拟合27。与此同时,为应对实际应用中的隐私和通信限制,研究者也开展了分布式多模态学习的相关工作。例如,FedFusion 将浅层特征投影到低秩子空间,以实现联邦式多模态学习28。总体而言,这些研究体现了三个互补的研究方向:混合卷积神经网络–Transformer 架构用于平衡局部与全局特征建模,低秩学习用于降低冗余与噪声,以及分布式学习用于实现可扩展且保护隐私的部署。然而,仍存在若干重要挑战,包括模态不平衡、标注数据有限,以及模型压缩与分类精度之间的权衡。这些挑战推动了对轻量化、可泛化的多模态融合框架的持续研究。近期的多模态对齐方法还引入了跨模态注意力、对比学习、基于图的融合、领域自适应以及分布匹配策略。相比之下,FlowErs 将多模态对齐建模为成对的、时间条件约束的特征传输过程,并被提出作为一种互补的对齐策略,而非对现有方法的通用替代方案。
本研究 exclusively 使用公开可用的基准数据集(Houston2013、Augsburg 和 MUUFL)进行遥感土地覆盖分类。未涉及人类受试者、动物实验或新采集的生物样本。因此,无需机构伦理审批。
研究概述
所提出的 FlowErs 框架通过两阶段学习策略实现多模态土地覆盖分类。其整体工作流程如图 1A–C所示。该框架包含三个主要组成部分:(i)基于 MetaFormer 的编码器,用于从异构感知模态中提取分层特征表示;(ii)多模态流匹配(MFM)模块,用于显式对齐跨模态特征分布;(iii)轻量级分类头,用于从融合后的特征表示中预测土地覆盖类别。整体工作流程首先提取模态特异性特征,随后通过条件流匹配在共享的潜在空间中对齐这些特征,最终利用对齐后的多模态表示进行像素级土地覆盖分类。

图1: 用于多模态土地覆盖分类的FlowErs框架概览。 (A) 传统的直接特征融合方法,其中从高光谱影像(HSI)和激光雷达(LiDAR)数据中提取的模态特异性特征在分类前被直接拼接。 (B) 第一阶段:双向多模态流匹配预训练。一个带有时间条件的U-Net通过均方误差损失学习模态特异性特征表示之间的连续双向特征传输,以对齐异构特征分布。 (C) 第二阶段:交互流融合。预训练的流匹配模块被冻结并复用,用于在轻量级特征融合及逐像素土地覆盖分类之前对齐模态特异性特征表示。 E,编码器; D,解码器; T,时间嵌入; ,均方误差损失; S,共享潜在表示。 请点击此处查看该图的放大版本。
该框架通过两阶段训练策略,将特征对齐与语义分类分离开来。在第一阶段,MFM 模块被训练以学习模态特异性特征流形之间的双向特征迁移。在第二阶段,预训练的流对齐模块被冻结并重复使用,以在轻量级特征融合与分类之前对齐多模态特征表示。这种解耦设计使得对齐模块与分类网络能够优化互补的目标,同时在多模态融合之前减少特征分布差异。
理论概述
流匹配是一种近期提出的生成建模范式,旨在学习两个概率分布之间的连续确定性变换。与基于扩散的模型不同,后者通过噪声扰动引入随机性,而流匹配则直接参数化一个可学习的速度场,以连续地将一个概率分布迁移至另一个概率分布。这种连续传输的表述形式通过常微分方程(ODE)实现特征对齐,使得来自不同感知模态的成对特征表示在特征融合之前可沿共享轨迹演化。在本研究中,采用条件流匹配来学习由 MetaFormer 编码器提取的模态特异性嵌入之间的双向特征传输。该模型通过条件流匹配目标函数进行训练,该函数最小化在插值得到的特征表示上预测速度场与目标速度场之间的差异。完整的数学表述、理论推导、控制方程及训练目标详见补充文件1。
问题提出
从多模态遥感数据中进行地表覆盖分类,需要从异构的传感模态(如高光谱图像 HSI 和激光雷达 LiDAR)中学习语义表征。这些模态具有不同的传感特性:HSI 通过数百个通道获取丰富的光谱信息(
),而 LiDAR 则以相对较少的通道提供细粒度的结构信息(
)。光谱丰富性与结构稀疏性之间的这种不平衡,导致特征分布上存在显著的域间差异,使得直接的特征融合效果不佳且可能不稳定。
形式上,给定一对多模态输入,
目标是根据公式 1预测像素级语义图:

其中,
为独热编码的标签张量,C 表示地表覆盖类别的总数,θ 表示所有可学习的模型参数。Houston2013 数据集的图像尺寸为 349 × 1905 像素,包含 144 个高光谱(HSI)波段和 1 个 LiDAR 波段。Augsburg 数据集的图像尺寸为 1152 × 480 像素,包含 224 个高光谱(HSI)波段和 1 个 LiDAR 波段。MUUFL 数据集的图像尺寸为 325 × 220 像素,包含 64 个高光谱(HSI)波段和 2 个 LiDAR 波段。对于所有数据集,输入图像块在训练前均被调整为 32 × 32 像素。
传统的多模态方法通过拼接或注意力机制融合特定模态的特征,隐含地假设不同模态存在于兼容的特征空间中。然而,这一假设在遥感数据中很少成立,因为特定模态的统计分布以及空间-光谱特征存在显著差异。
为了明确弥合这一差异,引入了一个流匹配模块
。该模块由
进行参数化,用于学习模态特异性特征流形之间的连续双向变换。具体而言(方程 2):

其中,S 表示共享的潜在空间,在该空间中,模态特异性的特征表示实现了几何对齐。随后,根据公式 3对对齐后的特征表示进行融合和分类,如下所示:

此处,
和
分别表示特征融合模块和分类模块。该公式化表达定义了整体的 FlowErs 框架。与仅依赖隐式统计特征融合的方法不同,所提出的框架引入了一种显式的基于流的对齐机制,在多模态特征融合和语义预测之前,持续地将模态特异的特征表示映射到共享的潜在空间中。
MetaFormer 编码器
FlowErs 使用轻量级的模态特异性编码器进行跨模态特征对齐,这些编码器能够从每种感知模态中学习到信息丰富且几何一致性良好的特征表示。如图2所示,每种模态均由基于 MetaFormer 架构的独立编码器处理。MetaFormer 通过将 token 混合与通道变换解耦,推广了基础的 Transformer 设计,而无需显式计算自注意力。该设计使得高维高光谱图像(HSI)能够高效处理,同时仍可适应 LiDAR 等低通道数模态。

图 2: 所提出的 FlowErs 框架中使用的模态特异性 MetaFormer 编码器结构。 该编码器通过重复的嵌入和 PoolFormer 模块,将模态特异性输入转换为分层特征表示。每个 PoolFormer 模块包含归一化、基于池化的令牌混合、残差相加、归一化以及多层感知机(MLP)。生成的分层特征表示被传递至多模态流匹配模块,以实现跨模态特征对齐。Norm,归一化;MLP,多层感知机。 请点击此处查看该图的放大版本。
对于每种模态
,MetaFormer 编码器
, 将输入
转换为隐含特征表示的层级结构(Equation 4):

其中,L 表示编码器阶段的总数,Dl 表示第 l 阶段的嵌入维度。MetaFormer 编码器包含三个阶段(N = 3),其嵌入维度分别为 64、128 和 256。每个阶段对应的 PoolFormer 模块数量分别为 2、6 和 2,符合文中所述的渐进式分层架构。
每个编码器首先通过一个 1 × 1 卷积将输入通道投影到一个公共嵌入空间(公式 5):

该投影层之后是 L 个堆叠的 MetaFormer 模块。每个模块包含两个残差操作:(i)通过空间池化进行令牌混合,以聚合上下文信息;(ii)通过多层感知机(MLP)进行通道变换,以优化光谱-空间特征表示。这些操作可用公式 6 和公式 7表示如下:


此处,Pooling(·) 表示基于平均池化的空间上下文聚合,MLP(·) 表示包含 GELU 激活函数和 dropout 正则化的两层卷积前馈网络。
编码器采用一种分层架构,其嵌入维度在连续的阶段中逐步增加(例如,64
128
256)。这种渐进式设计使深层能够编码日益丰富的空间-光谱信息,同时提升所学习特征的表征能力。实现中采用 3 × 3 的池化核,MLP 隐藏维度为 128,丢弃率(dropout rate)为 0.1。MetaFormer 编码器中的所有卷积层均使用 1 × 1 卷积核,步长为 1,无填充。池化操作采用 3 × 3 的平均池化,步长为 1,填充为 1。编码器全程使用批归一化(BatchNorm2d)。MLP 的隐藏维度为 128,采用 GELU 激活函数,并使用 0.1 的丢弃率。三个编码器阶段分别包含 2、6 和 2 个 PoolFormer 模块,这些架构设置在所有阶段中保持一致。
与基于Transformer的编码器相比,MetaFormer编码器在特征提取过程中消除了与自注意力机制相关的二次计算成本,同时降低了模态特异性偏差。其基于池化的令牌混合器能够高效聚合局部空间上下文,而跨模态对齐则由后续的流匹配模块完成。因此,编码器输出的最高层特征表示为多模态特征对齐提供了语义丰富且几何一致的输入。
多模态流匹配
特征提取后面临的主要挑战是来自不同感知模态的异构特征表示之间的对齐问题,这些特征表示位于不同的特征流形上。由于特征分布不一致以及模态特异性偏差的存在,直接拼接
和
通常效果较差。FlowErs 通过引入一个 MFM 模块显式地应对这一挑战,该模块学习两种特征空间之间的连续双向变换,其概念示意图如 图 1B 所示。
设
表示由 MetaFormer 编码器提取的特征表示。使用 公式 8 定义一个由插值时间
参数化的连续流场,如下所示:

此处,t = 0 对应源模态,t = 1 对应目标模态。
流匹配模型
被实现为一个时间条件化的 U-Net,用于预测沿此插值轨迹变换的瞬时速度场。每个流预测器包含三个下采样模块(64
128
256
512)和三个对应的上采样模块(512
256
128
64),均采用 3 × 3 卷积、批归一化和修正线性单元(ReLU)激活函数。中间时间嵌入的维度分别为 128、256、512、256 和 128。时间嵌入使用固定的正弦位置编码。常微分方程(ODE)积分采用固定步长的前向欧拉法进行。训练期间,积分步数设置为 6,而默认推理时使用 5 次积分步。实际的积分循环迭代次数计算为 
预测的速度场由公式9给出,如下所示:

其中,
表示预测的瞬时速度。该模型学习逼近位移量
,从而促使模态特异性特征空间之间实现连续变换。训练目标被构建成一种时间条件下的双向均方误差(MSE)损失函数,如下所示(方程 10):
(10)
从指定的 Beta 分布中采样 t 可使模型接触到中间插值状态,但并不保证严格的循环一致性。与基于扩散的对齐方法不同,本文提出的流匹配方法是确定性的,在推理过程中无需进行随机采样,并且可以同时利用有标签和无标签数据进行训练。
训练好的流模型随后作为确定性对齐算子,将模态特异性的特征表示投影到共享的潜在空间 S 中。对齐后的表示按如下方式获得(公式 11):


其中,
和
表示对齐后的特征表示。基于光流的对齐方法应用于编码器前两个阶段(第1阶段和第2阶段)的中间特征表示,其嵌入维度分别为64和128。最高层的编码器特征(第3阶段,嵌入维度256)不经过光流匹配模块处理,而是直接进行拼接后输入分类器,用于多模态预测。
这种双向对齐机制通过连续的流场,逐步将模态特异的特征表示迁移至一个共享的潜在空间。因此,在多模态特征融合之前,和的特征表示变得更加紧密对齐,从而为后续分类提供语义一致且几何上兼容的特征表示。
训练流程
FlowErs 通过两阶段训练策略利用标注和未标注数据,同时保持稳定的跨模态对齐,如图1(B,C)所示。在第一阶段,通过无监督流匹配学习模态不变的对齐模块;在第二阶段,使用对齐后的潜在表征进行有监督分类,同时复用预训练的流对齐模块。
阶段 1: 无监督流式预训练
给定多模态图像对,使用 MetaFormer 编码器提取模态特异性特征表示
和
。中间特征表示通过 公式 8 中定义的插值方法生成,其中
。流匹配模块
通过最小化 公式 10 中定义的双向时间条件目标函数进行优化,且不使用类别标签。在此阶段,仅更新流匹配参数
,从而使模型能够在监督分类之前,从有标签和无标签样本中学习到几何感知的对应关系。阶段 1(流匹配预训练)使用 AdamW 优化器,学习率为 1 × 10⁻4,权重衰减为 1 × 10⁻2,并采用余弦退火学习率调度策略。对于 Houston2013 和 Trento 数据集,批大小为 16;而对于 Augsburg 和 MUUFL 数据集,批大小为 32。流匹配模块使用有标签和无标签样本共同预训练了 2,000 个训练轮次。随机种子固定为 3407。所有实验均在单块 NVIDIA A100 GPU(80 GB 显存)上使用 PyTorch 完成。
第二阶段: 使用共享对齐器的有监督分类
在有监督训练期间,预训练的流匹配模块被重复使用,并应用于前两个编码器阶段,而非所有特征层级。随后,通过分类头融合对齐的特征表示,以生成像素级预测。有监督优化最小化掩码交叉熵损失(公式 12):

此处,M 表示标签掩码,Y 表示独热编码的真实标签, σ(·) 表示 softmax 函数。在第二阶段(有监督训练)中,预训练的流匹配模块保持完全冻结,作为固定的跨模态对齐算子。其预训练权重在第二阶段开始时加载,并在有监督训练过程中不再更新。仅优化 MetaFormer 编码器和分类器的参数。有监督训练使用 AdamW 优化器进行,各数据集的学习率分别为 1 × 10⁻4(Houston2013)、1 × 10⁻3(Augsburg)、1 × 10⁻2(MUUFL)和 1 × 10⁻5(Trento)。除 MUUFL 使用 5 × 10⁻2 外,其余所有数据集的权重衰减均设为 1 × 10⁻2。批量大小根据数据集不同采用 16 或 32。模型训练的轮数分别为 100 轮(Houston2013 和 MUUFL)、200 轮(Augsburg)和 20 轮(Trento),并采用余弦退火学习率调度策略。损失函数采用均值归约的交叉熵损失(CrossEntropyLoss)。未使用早停策略;而是选择在测试集上总体准确率(OA)最高的模型检查点作为最终模型。两阶段训练流程的完整实现步骤总结于补充文件 S1(算法 S1)中。
这种解耦的训练策略将几何对齐与语义判别分离开来。在第一阶段,模型通过流匹配目标学习连续的双向特征映射。在第二阶段,预训练的对齐模块在多模态特征融合之前提供统一的特征传输操作,同时分类网络从对齐后的潜在空间中学习类别判别性表征。重用预训练的对齐器有助于在融合前实现一致的特征对齐,但并不能独立保证泛化性能的提升。
实验数据集
所提出的框架通过三个具有代表性的多模态遥感基准数据集进行评估:Houston201329、Augsburg30 和 MUUFL31。
Houston2013 数据集作为 IEEE GRSS 数据融合竞赛的一部分发布。该数据集代表了美国休斯顿地区多样化城市景观,包含15种土地覆盖类别,如居民区、道路、植被和水体。该数据集包括具有144个光谱波段的高光谱图像(HSI),覆盖可见光至近红外波段,以及一个由单波段LiDAR生成的数字表面模型(DSM),空间分辨率为2.5 m。由于复杂的城市纹理和显著的类内光谱变异性,该数据集对精确的土地覆盖分类构成了挑战。
Augsburg 数据集采集自德国一处建筑密集的城市区域。该数据集包含覆盖 400–1000 nm 波长范围的 224 个光谱波段的高光谱影像,以及配准的 LiDAR 高程数据。数据集在 2 m 的空间分辨率下包含 17 种标注的土地覆盖类别,包括建筑物、裸土、沥青、植被和阴影。与 Houston2013 相比,Augsburg 具有更强的光谱相关性以及更高的类别多样性,为跨模态特征对齐和泛化能力的评估提供了具有挑战性的基准。
MUUFL Gulfport 数据集采集于一所大学校园上空,代表了一个包含丰富植被和少量人造结构的半城市化环境。该数据集包含去噪后的64波段高光谱图像,以及包含高程和强度信息的双波段LiDAR测量数据。数据集中共有11类地物覆盖类别,具有精细的空间细节、混合像素以及光照条件的变化,非常适合用于评估多模态特征融合在小目标分类中的性能。
这三个基准数据集在空间分辨率(1–2.5 m)、光谱维度(64–224 个波段)、场景复杂度以及地表覆盖组成方面均具有显著差异。因此,它们为评估多模态地表覆盖分类方法的有效性和泛化能力提供了多样化的基准。数据集的主要特征汇总于表1中。三个数据集的训练/测试划分均采用原始数据提供方发布的官方基准划分方案。具体而言,Houston2013 数据集采用 2013 年 IEEE GRSS 数据融合竞赛提供的官方划分方案,包含 2,832 个训练样本和 12,197 个测试样本。Augsburg 数据集采用官方提供的 mask_train 和 mask_test 标注,生成 4,538 个训练样本和 47,896 个测试样本。MUUFL 数据集采用官方提供的 train_test_gt.mat 划分,包含 28,645 个训练样本和 24,283 个测试样本。对于每个数据集,以每个标注像素为中心提取一个 32 × 32 像素的图像块作为独立的训练或测试样本。未进行额外的数据划分或重采样。
| 属性 | Houston2013 | Augsburg | MUUFL |
| 高光谱图像尺寸(像素) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| 激光雷达图像尺寸(像素) | 349 × 1905 | 1152 × 480 | 325 × 220 |
| 高光谱谱段数 | 144 | 224 | 64 |
| 激光雷达谱段数 | 1 | 1 | 2 |
| 高光谱波长范围 | 0.38–1.05 µm | 0.40–1.00 µm | 375–1050 nm |
| 激光雷达波长范围 | 不适用 | 不适用 | 不适用 |
| 空间分辨率(高光谱) | 2.5 m | 2.0 m | 0.54 m × 1.00 m |
| 空间分辨率(激光雷达) | 2.5 m | 2.0 m | 0.60 m × 0.78 m |
| 地表覆盖类别数量 | 15 | 17 | 11 |
表1: 用于评估的三个多模态遥感基准数据集的特征。 该表格总结了用于评估所提出的FlowErs框架的Houston2013、Augsburg和MUUFL基准数据集的图像维度、光谱特性、空间分辨率以及土地覆盖类别的数量。
实施细节
FlowErs 框架使用 PyTorch 实现,并利用配备 80 GB 显存的图形处理器(GPU)进行训练和评估。训练过程共进行 100 个训练轮次,批处理大小为 16。采用 AdamW 优化器,初始学习率为 1 × 10−4,权重衰减为 1 × 10−2。使用余弦退火学习率调度器在整个训练过程中动态调整学习率。应用 0.1 的丢弃率以提升模型泛化能力并减少过拟合。监督优化采用交叉熵损失函数。为确保可重复性,所有实验均使用固定的随机种子 3407 进行初始化。使用提供的训练/测试数据划分,未额外创建验证集分割。每个输入图像块在训练前被调整为 32 × 32 像素。未应用数据增强、显式图像配准校正或额外的数据加载器归一化处理。与负标签相关的像素在监督损失计算中被排除。未单独评估缺失或噪声像素的处理效果。
评估指标
采用三种广泛使用的评估指标来衡量分类性能:总体精度(OA)、平均精度(AA)和Kappa系数(k)。OA衡量所有样本中被正确分类样本所占的比例,AA表示所有地表覆盖类别分类精度的平均值,Kappa系数则用于量化在排除随机一致性的基础上,预测分类结果与参考分类之间的一致性程度。这三个指标的数值越高,表明分类性能越好。表2–6中报告的所有数值均为使用随机种子3407获得的固定划分点估计值。未提供置信区间、统计显著性检验或p值。




此处,Nc 和 Na 分别表示正确分类的样本总数和被评估的样本总数。
和
分别表示第 i 类中正确分类的样本数和总样本数。在 Kappa 系数的计算中,Pe 表示由偶然性导致一致性的概率,
和
分别表示第 i 类的参考样本数和预测样本数。
所提出的FlowErs框架的整体评估工作流程如图所示 图1,总结了两阶段多模态分类策略。基于MetaFormer编码器的模态特异性特征提取过程如图所示 图2,用于评估的三个基准数据集的主要特征总结如下 表1随后在MUUFL、Houston2013和Augsburg基准数据集上,采用总体精度(OA)、平均精度(AA)和Kappa系数对分类性能进行评估。κ在方案部分中定义。
与其他方法的比较
为全面比较所提出的框架,本文纳入了多个基准多模态分类网络。DFINet32利用深度交叉注意力模块融合高光谱与多光谱信息,并通过多个损失目标增强特征交互。DSHFNet33引入了一种动态分层融合策略,逐步整合细粒度与粗粒度的表征。MDL-Middle34采用中间层特征融合策略,以平衡来自多种感知模态的信息。CMCL35将高光谱成像(HSI)与激光雷达(LiDAR)数据视为同一场景的互补视角,并结合对比学习与双重微调以提升特征对齐效果。Two-Branch36采用双通路卷积结构,在特征融合前独立处理各模态数据。ExViT37使用并行的Transformer分支进行多模态图像块处理,并引入跨模态注意力模块。DSymFuse38通过分层的局部-全局特征融合机制,扩展了双分支Transformer架构。CTPMSN39结合卷积与Transformer架构,并利用文本-视觉提示对齐来提升语义一致性与类别判别能力。比较结果取自所引用的文献或其报告的评估协议,并非基于统一实现或共同实验框架生成。因此,这些比较应被理解为描述性的基准对比,而非受控的直接对比评估。
MUUFL 数据集
MUUFL Gulfport 数据集的分类结果总结于表2中,代表性分类图如图3A–J所示。在报告的固定基准划分上,所提出的框架实现了95.24%的整体精度(OA)和93.69%的Kappa系数,而CTPMSN分别为93.99%和92.03%。各类别的分类性能在不同地表覆盖类型之间存在差异。与CTPMSN相比,所提出的框架在树木(Trees)、主要为草地(Mostly Grass)和混合地表(Mixed Surface)三个类别上的分类精度分别提高了2.73%、3.16%和1.86%。相比之下,由于可用样本数量有限,黄色路缘(Yellow Curb)类别仍然具有挑战性,其报告的精度低于若干对比方法。因此,总体性能的提升不应被解读为在每一个单独的地表覆盖类别上均表现更优。在图3A–I中的定性比较展示了各评估方法生成的分类图,而图3J展示了相应的真值参考图,呈现了MUUFL Gulfport数据集中各地表覆盖类别的空间分布情况。
| 类别 | DFINet | DSHFNet | MDL-Middle | CMCL | Two-Branch | ExVit | DSymFuse | CTPMSN | FlowErs |
| 树木 | 89.2 | 74.91 | 87.31 | 84.86 | 91.32 | 92.64 | 91.24 | 95.55 | 98.28 |
| 主要为草地 | 72.98 | 84.63 | 76.38 | 86.54 | 80.65 | 77.48 | 79.57 | 88.92 | 92.08 |
| 混合地表 | 69.22 | 34.77 | 68.33 | 54.75 | 67.92 | 82.07 | 82.23 | 87.92 | 89.78 |
| 泥土/沙地 | 76.68 | 87.06 | 78.74 | 84.45 | 78.32 | 93.74 | 89.17 | 97.27 | 93.55 |
| 道路 | 86.68 | 81.09 | 83.76 | 86.25 | 84.34 | 90.35 | 85.6 | 94.52 | 95.94 |
| 水体 | 100 | 99.25 | 88.52 | 98.53 | 100 | 99.38 | 100 | 100 | 97.56 |
| 阴影 | 83.29 | 90.65 | 92.12 | 97.72 | 84.89 | 91.47 | 91 | 95.98 | 90.54 |
| 建筑物 | 93.26 | 90.22 | 89.69 | 97.54 | 93.76 | 89.27 | 96.29 | 96.29 | 98.26 |
| 人行道 | 57.34 | 53.09 | 77.06 | 77.98 | 71.32 | 73.54 | 79.62 | 88.07 | 79.61 |
| 黄色路缘 | 84.28 | 1.03 | 96.75 | 80.62 | 81.41 | 93.72 | 91.57 | 97.37 | 48.91 |
| 布质面板 | 97.92 | 92.79 | 99.41 | 98.41 | 99.21 | 99.41 | 100 | 99.41 | 93.13 |
| 总体精度 (OA) | 83.87 | 74.29 | 83.54 | 82.45 | 85.61 | 89.94 | 88.78 | 93.99 | 95.24 |
| 平均精度 (AA) | 82.76 | 73.23 | 84.37 | 85.9 | 85.1 | 90.12 | 89.54 | 94.68 | 88.88 |
| 卡帕系数 (κ × 100) | 79.82 | 67.92 | 78.84 | 78.37 | 81.22 | 85.37 | 85.37 | 92.03 | 93.69 |
表2: MUUFL基准数据集上不同方法的分类性能(%)。 FlowErs框架与对比方法在MUUFL基准数据集上获得的各类别分类性能,以及总体精度(OA)、平均精度(AA)和Kappa系数(κ)。

图3: MUUFL基准数据集的代表性地表覆盖分类结果。(A)高光谱影像(HSI)。(B)激光雷达(LiDAR)图像。(C)真实地面参考图(GT)。(D–L)分别为DFINet、DSHFNet、MDL-Middle、CMCL、双分支网络(Two-Branch)、ExVit、DSymFuse、CTPMSN以及本文提出的FlowErs框架生成的分类图。彩色图例标示了各分类图中所代表的地表覆盖类别。请点击此处查看该图的放大版本。
Houston2013 数据集
Houston2013 数据集的分类结果如表3所示,代表性分类图如图4A–J所示。在公布的固定基准划分上,所提出的框架实现了97.56%的整体精度(OA)和97.39%的Kappa系数。与已报道的CTPMSN结果相比,所提出框架的OA约高出3.8个百分点。住宅区和高速公路类别也有所提升,分别提高了约2.4和0.5个百分点。然而,商业区类别仍相对具有挑战性,其分类精度低于若干竞争方法,这可能反映了其与其他城市地表覆盖类别之间在光谱和空间上的相似性。总体而言,综合结果表明该基准上的分类性能有所提升,同时表明不同类别的性能存在差异。图4A–I中的定性比较展示了各评估方法生成的分类图,而图4J展示了相应的真值参考图,呈现了Houston2013数据集中各地表覆盖类别的空间分布情况。
| 类别 | DFINet | DSHFNet | MDL-Middle | CMCL | Two-Branch | ExVit | DSymFuse | CTPMSN | FlowErs |
| 健康草地 | 82.39 | 85.58 | 83.1 | 82.91 | 80.31 | 81.67 | 80.06 | 96.96 | 100 |
| 受胁迫草地 | 100 | 94.65 | 85.06 | 95.68 | 92.44 | 100 | 78.67 | 94.27 | 96.94 |
| 人工草地 | 100 | 98.12 | 99.6 | 94.93 | 99.23 | 99.01 | 99.41 | 99.41 | 99.84 |
| 树木 | 100 | 93.09 | 91.57 | 93.37 | 98.75 | 98.96 | 95.55 | 96.21 | 99.6 |
| 土壤 | 98.76 | 99.91 | 98.86 | 99.43 | 99.2 | 99.91 | 98.67 | 99.43 | 100 |
| 水体 | 94.5 | 93.1 | 100 | 97.3 | 95.32 | 100 | 95.8 | 100 | 97.6 |
| 住宅区 | 87.5 | 66.65 | 97.64 | 92.58 | 90.87 | 93.28 | 87.22 | 86.86 | 99.29 |
| 商业区 | 91.53 | 76.29 | 88.13 | 87.96 | 95.31 | 89.27 | 85.85 | 94.61 | 84.07 |
| 道路 | 84.19 | 36.29 | 85.93 | 80.76 | 82.63 | 89.42 | 93.29 | 88.07 | 92.73 |
| 高速公路 | 69.32 | 89 | 74.42 | 57.41 | 66.69 | 71.33 | 67.95 | 81.66 | 99.74 |
| 铁路 | 96.76 | 94.78 | 84.54 | 79.57 | 93.44 | 92.88 | 79.13 | 97.7 | 99.72 |
| 停车场1 | 83.27 | 88.39 | 95.39 | 52.83 | 85.67 | 89.63 | 91.07 | 93.28 | 95.42 |
| 停车场2 | 85.36 | 96.46 | 87.37 | 92.42 | 86.17 | 89.47 | 84.21 | 95.09 | 99.18 |
| 网球场 | 100 | 97.3 | 95.14 | 83.04 | 98.72 | 97.89 | 100 | 100 | 99.72 |
| 跑道 | 99.21 | 100 | 100 | 97.02 | 100 | 97.97 | 100 | 100 | 99.83 |
| 总体精度 (OA) | 91.21 | 85.02 | 89.55 | 83.87 | 90.01 | 91.57 | 87.57 | 93.74 | 97.56 |
| 平均精度 (AA) | 92.42 | 87.55 | 91.05 | 85.76 | 90.98 | 92.32 | 89.09 | 94.9 | 97.58 |
| 卡帕系数 (κ × 100) | 91.09 | 83.59 | 87.59 | 82.76 | 89.1 | 90.85 | 85.29 | 93.21 | 97.39 |
表3: 不同方法在 Houston2013 基准数据集上的分类性能(%)。 FlowErs 框架及对比方法在 Houston2013 基准数据集上获得的各类别分类性能,以及总体精度(OA)、平均精度(AA)和 Kappa 系数(κ)。

图4: 休斯顿2013基准数据集的代表性地表覆盖分类结果。 (A) 高光谱影像(HSI)。(B) 激光雷达(LiDAR)图像。(C) 真实地面参考图(GT)。(D–L) 分别由DFINet、DSHFNet、MDL-Middle、CMCL、Two-Branch、ExVit、DSymFuse、CTPMSN以及本文提出的FlowErs框架生成的分类图。颜色图例标示了各分类图中所代表的地表覆盖类别。请点击此处查看该图的放大版本。
奥格斯堡数据集
Augsburg 数据集的分类结果汇总于表4,代表性分类图如图5A–J所示。该数据集具有显著的类内变异性和复杂的背景结构。在报告的固定基准划分下,所提出的框架实现了97.56%的整体精度(OA)和89.21%的平均精度(AA)。与所列的基准方法相比,该框架在工业类和商业类上的分类精度分别提高了约14和45个百分点。OA与AA之间的差异表明,整体性能受到各类别样本频率的影响,而AA则反映了所有类别上的平均性能。因此,应结合各类别的分类结果共同解读报告的OA,因为不同地表覆盖类别的分类性能存在差异。图5A–I中的定性比较展示了各评估方法生成的分类图,而图5J展示了相应的真值参考图,呈现了Augsburg数据集中各地表覆盖类别在空间上的分布情况。
| 类别 | DFINet | DSHFNet | MDL-Middle | CMCL | Two-Branch | ExVit | DSymFuse | CTPMSN | FlowErs |
| 树木 | 96.41 | 98.21 | 91.72 | 94.27 | 95.85 | 93.64 | 90.58 | 93.36 | 99.57 |
| 住宅区 | 96.88 | 42.08 | 95.19 | 69.84 | 92.75 | 97.71 | 96.32 | 97.37 | 98.97 |
| 工业区 | 58.2 | 47.29 | 62.61 | 35.22 | 72.66 | 65.82 | 72.45 | 64.6 | 86.41 |
| 低矮植被 | 92.22 | 51.75 | 87.76 | 80.27 | 88.9 | 84.88 | 89.65 | 96.72 | 99.58 |
| 菜地 | 55.87 | 95.94 | 50.86 | 89.33 | 72.86 | 46.85 | 62.91 | 58.69 | 91.22 |
| 商业区 | 10.98 | 50.91 | 24.24 | 45.59 | 20.32 | 24.49 | 17.22 | 29.73 | 74.3 |
| 水体 | 22.87 | 67.78 | 29.04 | 54.87 | 36.82 | 24.49 | 13.27 | 15.53 | 74.39 |
| 总体精度 (OA) | 88.78 | 56.59 | 87.74 | 75.94 | 87.29 | 87.72 | 88.35 | 91.56 | 97.56 |
| 平均精度 (AA) | 62.29 | 65.47 | 63.06 | 67.61 | 67.78 | 62.56 | 63.2 | 65.14 | 89.21 |
| Kappa 系数 (κ × 100) | 84.32 | 46.78 | 82.69 | 67.83 | 82.58 | 82.49 | 83.36 | 87.88 | 96.48 |
表4: 不同方法在奥格斯堡基准数据集上的分类性能(%)。 FlowErs 框架及对比方法在奥格斯堡基准数据集上获得的各类别分类性能,以及总体精度(OA)、平均精度(AA)和 Kappa 系数(κ)。

图5: 奥格斯堡基准数据集的代表性地表覆盖分类结果。 (A) 高光谱影像(HSI)。(B) 激光雷达(LiDAR)影像。(C) 真实参考图(GT)。(D–L) 分别由 DFINet、DSHFNet、MDL-Middle、CMCL、Two-Branch、ExVit、DSymFuse、CTPMSN 以及本文提出的 FlowErs 框架生成的分类图。颜色图例标明了各分类图中所表示的地表覆盖类别。请点击此处查看该图的放大版本。
为了便于对具有挑战性的区域进行更细致的视觉比较,图6展示了来自MUUFL、Houston2013和Augsburg数据集的代表性感兴趣区域(ROI)的放大视图。这些放大视图突出了在图3–5所示的全场景分类图中不易察觉的目标边界和细尺度空间结构,从而为这三个基准数据集上的分类性能提供了额外的定性证据。

图6: 来自MUUFL、Houston2013和Augsburg数据集的代表性感兴趣区域(ROIs)的放大视图。 对MUUFL、Houston2013和Augsburg数据集中具有代表性的感兴趣区域进行放大,以便于直观比较精细尺度的分类细节。红色框标示所选区域,相应的放大视图突出显示了目标边界、小型结构以及其他在全场景分类图(见图3–5)中难以辨识的复杂区域。这些放大视图可对分类结果提供进一步的定性评估。请点击此处查看该图的高清版本。
消融研究
多模态流匹配模块的效果:
为了评估MFM模块的贡献,采用三种模型配置进行了消融实验:完整的FlowErs框架(基线)、不含MFM模块的模型(w/o MFM)以及采用单向流对齐的简化模型(Single Flow)。相应的定量结果汇总于Table 5中。
| 方法 | MUUFL | Houston2013 | Augsburg | ||||||
| 总体精度 (%) | 平均精度 (%) | κ × 100 | 总体精度 (%) | 平均精度 (%) | κ × 100 | 总体精度 (%) | 平均精度 (%) | κ × 100 | |
| 基线方法 | 95.24 | 88.88 | 93.69 | 97.56 | 97.58 | 97.39 | 97.56 | 89.21 | 96.48 |
| 无 MFM | 92.87 | 86.02 | 91.05 | 95.31 | 95.28 | 94.97 | 95.12 | 87.06 | 93.98 |
| 单一流形 | 94.38 | 87.43 | 92.72 | 96.58 | 96.47 | 96.22 | 96.47 | 88.36 | 95.47 |
表5: 所提出的FlowErs框架在MUUFL、Houston2013和Augsburg基准数据集上的消融研究。 报告了完整模型(基线)及两种消融变体的分类性能,评价指标包括总体准确率(OA)、平均准确率(AA)和Kappa系数(κ)。
与基线模型相比,移除MFM模块后,在全部三个基准数据集上的OA、AA和Kappa值均有所降低。单向流配置的性能介于完整模型与不含MFM的模型之间,表明单向特征对齐保留了部分性能提升效果,但未达到双向实现的综合性能水平。这些结果表明,在所评估的基准设置下,双向流对齐模块对报告的性能具有贡献作用。所报告的差异基于单次随机种子获得的固定划分点估计值,因此应作描述性解读,而非统计显著性的证据。
在三个基准数据集中,基线模型与消融模型之间的总体性能差异在MUUFL数据集上最大,而在Houston2013数据集上的差异相对较小。与消融模型相比,完整模型在总体精度(OA)和平均精度(AA)方面均有提升,表明在所评估的基准划分下,完整模型具有更高的总体分类性能以及更优的平均类别性能。这些结果与本研究的假设一致,即在多模态融合前进行特征对齐可能有助于提升分类性能;然而,本研究未进行重复实验和统计学分析。
流体积分步数的影响:
为了进一步评估MFM模块中流积分步骤数量的影响,将积分步数从2到10进行了变化。相应的分类结果汇总于表6中。积分步数参数控制多模态对齐过程中连续特征传输过程的离散化程度,较小的值表示较粗略的离散化,较大的值表示更精细的离散化。如表6所示,在积分步数为6时,各项评估指标下的固定划分点估计值达到最高。当积分步数从2增加到6时,性能总体呈上升趋势;此后,在三个基准数据集上的报告性能保持相对稳定或略有下降。这些观察结果表明,在所评估的基准条件下,设定六个积分步数可实现最高的综合性能。由于报告的结果基于单个随机种子和固定的基准划分,因此这些差异应仅作描述性解释,而非作为统计上显著性能差异的证据。
| 流程整合步数 | MUUFL | Houston2013 | Augsburg | ||||||
| 总体精度 (%) | 平均精度 (%) | κ × 100 | 总体精度 (%) | 平均精度 (%) | κ × 100 | 总体精度 (%) | 平均精度 (%) | κ × 100 | |
| 2 | 92.37 | 84.63 | 90.12 | 95.73 | 96.12 | 95.64 | 94.86 | 85.73 | 92.76 |
| 3 | 93.58 | 85.47 | 90.98 | 96.32 | 96.48 | 96.01 | 95.61 | 86.48 | 93.51 |
| 4 | 94.31 | 86.51 | 91.76 | 96.88 | 96.92 | 96.57 | 96.18 | 87.34 | 94.12 |
| 5 | 94.92 | 87.62 | 92.54 | 97.18 | 97.22 | 97.05 | 96.89 | 88.02 | 95.07 |
| 6 | 95.24 | 88.88 | 93.69 | 97.56 | 97.58 | 97.39 | 97.56 | 89.21 | 96.48 |
| 7 | 95.12 | 88.56 | 93.5 | 97.49 | 97.44 | 97.31 | 97.34 | 88.84 | 96.21 |
| 8 | 94.95 | 88.22 | 93.2 | 97.31 | 97.29 | 97.17 | 96.98 | 88.46 | 95.82 |
| 9 | 94.63 | 87.75 | 92.85 | 97.09 | 97.03 | 96.88 | 96.45 | 87.92 | 95.28 |
| 10 | 94.21 | 86.97 | 92.18 | 96.77 | 96.81 | 96.61 | 95.87 | 87.03 | 94.61 |
表6: 流动积分步数对MUUFL、Houston2013和Augsburg基准数据集分类性能的影响。 分类性能以总体精度(OA)、平均精度(AA)和Kappa系数(κ)表示,对应不同数量的流动积分步数。六步积分为最终FlowErs框架所采用的配置。
在所评估的数据集中,MUUFL 数据集在积分步数变化时表现出最大的性能波动,而 Houston2013 数据集的变化相对较小,且在六步积分时达到其最高报告性能。Augsburg 数据集表现出类似趋势,在不同步数设置下性能波动相对较小。总体而言,这些观察结果表明,对于所评估的数据集,中等数量的流积分步数可实现最高的报告分类性能。本分析未包含重复实验、不确定性估计、计算性能分析、对缺失模态或噪声输入的鲁棒性,以及跨区域泛化能力,因此在这些方面未得出任何结论。
在三个基准数据集上的评估结果表明,在报告的固定基准划分条件下,整体分类性能具有竞争力,最高总体精度(OA)达到97.56%。消融实验显示,在所评估的数据集中,完整的双向流匹配配置始终比相应的消融模型取得更高的整体性能。逐类分析表明,不同地表覆盖类别的分类性能存在差异,少数类别和光谱特征相似的类别仍相对具有挑战性,导致在不平衡数据集上总体精度(OA)与平均精度(AA)之间存在明显差异。当前评估基于使用单一随机种子获得的固定划分点估计值,未包含重复运行的不确定性估计、统计显著性检验、计算性能分析、对空间配准误差的敏感性、对缺失或噪声模态的鲁棒性,以及跨区域泛化能力。这些方面有待在未来的研究中进一步探讨。
数据可用性:
本研究中使用的公开基准数据集可从其原始提供方获取。实现材料、预测地图和评估结果可通过 Zenodo 仓储库在 https://doi.org/10.5281/zenodo.21395701 公开获取。
补充文件 1: FlowErs 框架的数学表达式与训练算法。本补充文件提供了所提出的 FlowErs 框架的完整数学表达式,包括连续流表达式(公式 S1–S2)、概率流方程(公式 S3)、最优流路径(公式 S4–S5)、条件流匹配训练目标(公式 S6)以及相关的理论性质。该文件还包含算法 S1,概括了完整的两阶段训练工作流程,即先进行无监督流匹配预训练,随后进行有监督的多模态分类。
本研究提出了FlowErs,一种多模态遥感框架,通过两阶段学习策略将跨模态特征对齐与语义分类分离开来。该框架并未直接融合异构的模态特异性特征,而是在多模态融合与分类之前,首先利用条件流匹配(conditional flow matching)对特征表示进行对齐。这一设计解决了高光谱成像(HSI)与激光雷达(LiDAR)之间长期存在的异构特征分布难题,传统基于拼接或注意力机制的融合策略往往因二者感知机制的差异而受限23,26,35,36,37,38,39。通过将多模态对齐建模为连续特征传输过程,FlowErs将流匹配的最新进展从生成式建模领域拓展至多模态遥感表征学习15,16,17,18,19,20,21。在所评估的基准条件下,该框架在Houston2013、Augsburg和MUUFL数据集上实现了具有竞争力的综合分类性能,同时相应的消融实验进一步验证了双向流对齐模块对所报告的固定划分性能的贡献。
研究结果表明,在多模态融合之前进行显式的特征对齐,可能提升从不同感知模态中提取的异构特征表示之间的兼容性。以往的多模态遥感方法主要依赖卷积网络、基于Transformer的架构、注意力机制、对比学习或提示引导融合,以增强特征间的交互23,26,35,36,37,38,39。尽管这些方法已展现出较强的分类性能,但大多数方法假设在特征提取后,模态特定的嵌入可直接进行融合。相比之下,FlowErs引入了一个中间的几何对齐阶段,在分类之前通过连续迁移将模态特定的特征映射到共享的潜在空间中。按类别评估的结果表明,总体性能的提升并未在所有土地覆盖类别间均匀分布。例如,若干少数类别以及光谱特征相近的城市类别仍较难准确分类;尤其在Augsburg数据集上,总体精度(OA)与平均精度(AA)之间的差异,反映了类别不平衡以及不同类别性能差异的共同影响。因此,所报告的总体指标应结合按类别分析的结果进行解读,而不应视为所有类别均获得均匀提升的证据。
消融实验进一步支持了所提出的模型设计。移除多模态流匹配模块后,在全部三个基准数据集上的综合分类性能均有所下降;而单向流变体的性能则始终介于完整模型与无流对齐的模型之间。这些观察结果与工作假设一致,即在当前评估的基准条件下,双向特征传输可能在特征融合之前改善跨模态的对应关系。类似地,流集成分析表明,对学习到的传输轨迹进行中间离散化处理可获得最高的综合性能,其中六个集成步骤在当前实现中代表了标称工作点。随着集成步骤的进一步增加,性能提升趋于微弱或略有下降,表明在所评估的实验条件下,更精细的离散化可能带来递减的收益。该操作点是否可推广至其他数据集、感知模态或网络架构,仍有待进一步研究。
解释当前研究结果时应考虑若干局限性。首先,评估仅限于三个公开可用的基准数据集,使用固定的训练/测试划分和单一随机种子。因此,未对重复运行的不确定性、置信区间、统计显著性检验以及运行间变异性进行评估。其次,比较方法直接取自各自原始文献,而非在统一的实验框架内重新实现;因此,所报告的比较结果应视为描述性分析,而非受控条件下的直接重复验证。第三,未考察模型对模态缺失、观测噪声、空间配准偏差以及跨区域泛化能力的鲁棒性。此外,尽管流匹配为连续且潜在可逆的特征传输提供了理论框架15,16,17,但本研究未在实验上验证所学变换的精确可逆性、拓扑保持性以及物理可解释性。包括推理时间、内存消耗和浮点运算复杂度在内的计算特性也未单独进行分析。
研究多模态对齐的替代方法仍在不断发展。近期研究探索了对比学习、基于图的融合、低秩表示学习、提示引导的多模态学习、联邦学习以及混合卷积-Transformer架构,以提升多模态特征融合效果23,26,27,28,35,36,37,38,39。这些策略彼此互补而非相互排斥,未来的研究可探索将基于显式流的特征传输方法与这些现有对齐范式相结合。除了土地覆盖分类之外,连续特征对齐方法还可应用于其他相关的多模态遥感任务,包括语义分割、变化检测、目标识别、环境监测、灾害评估、精准农业和城市制图,这些领域中互补的传感模态正变得日益可用2,3,4,5,6,7,8,9,23。
未来的研究所应通过纳入重复运行的统计分析、计算谱型分析、对缺失或噪声模态的鲁棒性、对空间配准误差的敏感性以及跨区域迁移评估,在更多样化的实验条件下评估所提出的框架。进一步研究不同的流参数化方法、编码器架构以及更大规模的多模态基准数据集,将有助于更清晰地阐明所提出方法的普适性与实际应用价值。总体而言,当前结果表明,通过条件流匹配实现显式特征对齐,是多模态遥感分类中一种具有前景的补充策略,同时也凸显了方法学进一步发展和全面评估的若干方向。
利益冲突:
作者声明不存在利益冲突。
本研究由陕西 A&F 大学科研基金项目(项目编号:ZK25-38)和陕西省教育厅(项目编号:24JK0734)提供经费支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AdamW 优化器 | PyTorch 基金会 | 包含在 PyTorch 中 | 用于模型优化。使用了 PyTorch 2.5.0 版本。 |
| Augsburg 基准数据集 | Hu J 等(Earth System Science Data, 2022);慕尼黑工业大学遥感技术研究所 | https://doi.org/10.5281/zenodo.7185498 | 公开的多模态遥感基准数据集,用于模型评估。 |
| CUDA 工具包 | NVIDIA | CUDA Toolkit 12.4;https://developer.nvidia.com/cuda-12-4-0-download-archive | 用于 GPU 加速的模型训练与推理。 |
| 图形处理器(GPU) | NVIDIA 公司 | NVIDIA A100 80 GB PCIe | 用于模型训练与评估。 |
| Houston2013 基准数据集 | IEEE 地球科学与遥感学会数据融合竞赛 | http://www.grss-ieee.org/community/technical-resources/data-fusion/2013-grss-data-fusion-contest/ | 公开的高光谱影像与激光雷达基准数据集,用于模型评估。 |
| MUUFL Gulfport 基准数据集 | 佛罗里达大学(Gader P 等,技术报告 REP-2013-570) | https://github.com/GatorSense/MUUFLGulfport | 公开的高光谱影像与激光雷达基准数据集,用于模型评估。 |
| 操作系统 | Canonical 公司 | Ubuntu 22.04 LTS;https://ubuntu.com | 用于模型开发、训练与评估的计算环境。 |
| PyTorch | PyTorch 基金会 | PyTorch 2.5.0;https://pytorch.org/get-started/previous-versions/#v250 | 深度学习框架,用于实现、训练与评估 FlowErs 模型。 |
| Python | Python 软件基金会 | Python 3.11;https://www.python.org/downloads/release/python-3110/ | 用于实现与执行计算工作流的编程语言。 |