OlmoEarth v1.1:更高效的地球观测模型家族

Allen AI 发布了 OlmoEarth v1.1,这是其地球观测模型系列的一个新版本。核心改进是:在保持 v1 性能的前提下,将计算成本降低了最多 3倍

效率提升的关键在于减少 Transformer 模型处理的 token 序列长度。因为计算成本与 token 序列长度成二次方关系。对于 Sentinel-2 这样的多光谱数据,v1 版本的处理方式是:将每个空间 patch 按照不同分辨率(10m、20m、60m)拆成多个 token。一个包含 2 个时间步的输入,每个 patch 会产生 6 个 token(2 时间步 x 3 分辨率)。而 v1.1 将同一 patch 内不同分辨率的波段(band)合并成一个单一的 token,token 数量直接减少为原来的 1/3。

但是,简单粗暴地合并 token 会导致性能显著下降,例如在 m-eurosat kNN 基准测试上准确率会下降 10 个百分点。因为分离不同波段有助于模型学习跨波段的复杂关系。为了在不影响性能的前提下合并 token,团队修改了预训练方案,具体细节在技术报告中详细说明。

最终结果是,在任意模型尺寸下,v1.1 的运行成本都比 v1 便宜最多三倍。这对于需要频繁进行全球尺度地图更新的团队来说,意义重大。模型基于与 v1 相同的训练数据集,因此方法上的差异可以直接归因于新设计,对研究者理解遥感预训练的科学原理也有帮助。目前 v1.1 的权重(包括 Base、Tiny、Nano 三种尺寸)和训练代码已在 GitHub 和 Hugging Face 上开源。

OlmoEarth v1.1: A more efficient family of Earth observation models

查看原文