Table of Contents
卫星图像分类的基本原理
卫星图像分类是遥感的一项核心任务,它为卫星图像中的每个像素或物体划定了土地覆盖标签——如森林、城市、水和农业等——精确分类支持环境监测、城市扩张分析、灾害反应和农业管理,传统的分类方法依赖以像素为基础的统计方法,如最大可能性或人工光解,这些方法需要劳力密集,需要专家对研究领域的了解,往往与不同的景观或混合像素相搏,向机器学习的转变在速度和精确性方面都取得了很大进展,特别是卫星数据量随着诸如Copernicus Sentinel等星座和商业提供者的生长而大增。
卫星图像以可视、近红外、短波红外和热波等多种光谱带记录,每种光谱带都捕捉到表面材料的不同特性。 分类器必须利用这些光谱特征,同时考虑空间背景、大气效应和季节性变化。机器学习算法直接从标签式培训样本中学习差别性模式,从而减少了人工阈值或规则建设的需要。 这种适应当地数据分布的能力使机器学习现代分类工作流程的主要范例。
卫星图象分类关键机器学习算法
支持矢量机
支持矢量机(SVM)是监督学习模型,在高视域特征空间中找到最佳超平面分离类。对于卫星图像来说,特征空间通常包括光谱波段值、植被指数或纹理测量。SVM算法确定支持矢量——培训最接近决定边界的样本——并利用它们来最大限度地扩大各类之间的距离。通过内核战术(辐射基础功能、多诺米亚或西格莫德),SVMs能够模拟非 ⁇ 线性边界,而没有明确改变输入空间。SVM在多类区域中,使用小到中度的培训数据集,并显示出强有力的土地覆盖分类结果。然而,SVM的性能取决于调高参数C和内核γ等超参数,这往往需要交叉验证。遥感中SVM应用的全面审查可在Mountrakis et al.(2011)中找到。
随机森林
随机森林是一种由许多决策树组成的组合方法,每个决策树都受过数据的一个带和随机的带。在分类过程中,每个树对一个类的投票和多数决定都是由来已久的。这种差异减少方法比单一决策树减少了过度适应,提供了内建的特征分数,帮助解释哪些光谱带或植被指数最有助于分离。随机森林很强,能发出噪音、缺失数据和高维特征空间,使其成为运行中的土地覆盖图的Go oto算法。它能够高效地处理大型数据集,并且可以并行。随机森林已被广泛用于像 粮农组织全球森林资源评估这样的产品。其主要局限在于它仍然能够过度适应非常吵或不平衡的数据集,尽管分解取样和分解重量调整等战略减轻了这种情况。
深神经网络(革命神经网络).
神经网络(CNN)已成为卫星图象分类的状态,特别是在空间背景和纹理模式至关重要的情况下。CNN自动从原始像素输入中学习等级特征—— 尖端、形状和物体—— 跨越多个演化层和集合层。 利用像成像网这样的大型自然图像数据集预先训练的网络进行转移学习,可以对遥感任务进行微调,贴上较少标签的卫星图像。ResNet、UçNet和高效网络等建筑通常为像素的语义分区进行改造,每个像素都配有一类。CNN擅长捕获复杂的模式,如公路网络、建立足迹和作物边界。然而,它们需要大量的附加说明的数据集、大量的计算资源(GPU),并小心规范,以避免过度配置。ISPRS基准数据集为评价CN在航空和卫星图像方面的性能提供了标准化的试验床。
近邻
K ⁇ nest Nearbours(KNN)是一个非参数化的、基于实例的学习者,以多数表决的方式将像素归入其在特征空间中最接近的训练样本。远程测量标准如欧几利得、曼哈顿或马哈拉诺比斯用于计算邻近程度。KNN简单易行,不需要明确的训练阶段,在基础班级分布独特、培训数据具有当地代表性的情况下,效果良好。对于小数据集或基线方法来说,它仍然有用。尽管它简单,KNN在高视谱空间中存在对维度的诅咒,而且大型训练集的计算效率低下,每个查询都需要对所有实例进行粗糙的X=力扫描。在使用KNN之前,经常应用诸如PCA或特征选择等维度降低技术。
机器学习对传统方法的优势
- 复杂地貌中的高度精确性: 传统方法假设高斯分布或线性分离,而机器学习算法则捕捉现实世界卫星图像中常见的非线性、多模式关系。 例如,随机森林和CNN在基准数据集中通常产生超过90%的整体加速,比最大概率分类器高出10–20个百分点。
- 特性工程的自动化: 深层学习模型学习空间和光谱特征 end oto end,减少了设计手工制作的指数或纹理过滤器所需的人工努力,降低了非专家制作高质量地图的障碍。
- 能够对大数据量进行可扩展性: 机器学习管道可以使用分布式计算框架平行处理卫星数据的兆字节。这种可扩展性对于以高瞬间分辨率生成全球土地覆盖产品至关重要。
- 适配性和持续改进: 模型可以在新的实地调查数据出现后重新训练,从而能够不断更新分类图. 主动学习策略也通过选择最丰富的标本进行注释来减少标签努力.
挑战和限制
数据要求和标签费用
所有受监督的机器学习模型都需要大量准确标记的培训数据。 对于卫星图像来说,地面真实数据通常来自实地调查、分辨率较高的图像或现有的土地覆盖图。为不同的地理区域和生物阶段获得这种标记既昂贵又费时。 正在开发一些脆弱的、自我监督的学习方法,以减轻这一瓶颈,但它们仍然是积极的研究前沿。
计算要求
深神经网络尤其需要强大的GPU和大型内存来进行高分辨率多分光谱瓦的培训. Cloud based service 如Google Earth Earth Engine和Amazon SageMaker 提供可扩展计算,但大型项目的成本可能相当大. 模型压缩,推算和轻量级架构(如MobileNet)正在出现,以减少在边缘设备或卫星平台部署的计算要求.
过于适应和普遍化
机器学习模型可以过度适应培训数据,特别是在数据集小或不平衡的情况下。 常规化技术(抛出、重量衰减、早期停止)和交叉验证帮助,但将一个在某一区域受过训练的模型转移到另一个具有不同土地覆盖特征的模型,往往会降低性能。 域改造方法和多源培训是积极研究的领域,目的是改进跨空间和时间领域的通用性。
模型可解释性
深神经网络等复杂的模型是“黑盒 ” , 这使得人们难以理解为什么将某一像素归类为森林而不是灌木地。 解释性工具(如SHAP、LIME、GradXCAM)正在被改造,用于遥感,以确定哪些光谱带或空间模式驱动分类决定。 这对规范或科学应用尤为重要,因为模型推理必须透明。
未来方向和新趋势
深入学习和卫星图像分类的一体化继续迅速发展,原先为自然语言处理而开发的注意机制和变压器结构正在调整,以捕捉卫星图像中长期空间依赖性,在某些分化任务上优于CNN. 自我监督的未贴标签图像上的学习预分模型,然后用很少的标签对其进行微调,大大减少了注释的需要,此外,利用多模式神经网络对雷达和光学数据进行聚合,改善了云易发区域的分类。
结论
机器学习算法已经将卫星图像分类从人工、统计演练转变为能够处理大量数据流的自动化高精度过程。 支持矢量机器、随机森林、深神经网络,以及KQX近邻等更简单的方法,为不同的应用提供了具体优势,而深入学习现在成为前沿。 尽管数据标签、计算成本和可解释性方面持续面临挑战,但积极研究自我监督学习、模型压缩和域域调整有望使这些工具更加易用和有力。 继续将机器学习与卫星地球观测相结合,将为环境管理、气候复原力和可持续发展提供关键见解。