← 返回日报
🌐 机器翻译 · DeepSeek · HF Blog

The OlmoEarth Platform: Geospatial inference at planetary scale


OlmoEarth 平台:行星尺度的地理空间推理

企业文章 发布日期:2026年7月28日 点赞 11 +5 Kyle Wiggers Ai2Comms 关注 allenai


为什么卫星推理具有挑战性

为合适的任务选择合适的硬件

一个请求、数百个工作节点、数千个进程

查找并获取正确的像素

处理大规模故障

我们的未来方向

🌍 了解更多关于 OlmoEarth 平台:https://allenai.org/olmoearth

OlmoEarth 模型是我们家族的地球观测基础模型,基于约 10 TB 的多模态卫星数据进行了预训练。政府、非政府组织及其他使命驱动型组织已经在将 OlmoEarth 应用于森林砍伐监测、粮食安全和野火风险等领域。在 Ai2,我们深知如何训练并发布强大的开放模型;对于拥有强大工程团队的组织来说,开放模型足以让他们直接运行。然而,环境领域的大多数组织——那些最适合应用这些模型的机构——并不具备管理完整生命周期所需的基础设施或工程团队:包括数据标注、模型微调以及大规模推理。

我们运营像 Skylight 和 EarthRanger 这样的平台已有十多年,这些软件每天被全球用户依赖,因此必须每天稳定运行。这段经验让我们明白,要产生实际影响需要做到:在正确的时间和地点以经济高效的方式运行模型、监控性能、将原始输出转化为可操作的洞察,并验证这些输出能推动合作伙伴期望的成果。这就是我们构建 OlmoEarth 平台的原因——一个从微调和评估到大规模推理的地理空间模型基础设施。

这种规模的推理本身带来了一系列挑战。卫星图像必须跨多个提供商查找和访问,在不同投影和分辨率下进行对齐,并高效处理。结果随后需要拼接成地理上一致的图像,同时基础设施要从分布式计算的常规故障中恢复。如今,该平台可以在大约一天内完成跨大陆规模的推理,处理数十 TB 的图像,成本仅为每平方公里几分之一美分。开发它意味着要面对一系列工程挑战,其他从事大规模地理空间系统工作的人很可能也会遇到。本文将介绍这些挑战以及我们找到的解决方案。

近期在 OlmoEarth 平台上生成的野火风险图(附统计信息)。


为什么卫星推理具有挑战性

大多数机器学习模型接收几 MB 的数据并在不到一秒内产生结果——比如 LLM 处理一段文本,或计算机视觉模型分析智能手机拍摄的照片。地球观测推理的运行规模则完全不同:一个用于最大化性能的微调基础模型的任务,可能会移动 TB 级的数据并运行数小时。输入数据可能跨越多个光谱波段、传感器类型和时间步长,覆盖大片地理区域。这些数据可能来自多个提供商,每个使用不同的投影和分辨率,还可能包含缺失或被云层遮挡的观测数据。输出本身是一张地图,因此每个预测必须与周围区域保持精确的投影和坐标网格对齐。

即使是获取数据本身也可能是一个重大挑战。预测任务通常花费更多时间下载和准备图像,而不是运行模型本身,这使得高效的数据管道至关重要。这些管道必须处理高吞吐量的 I/O,同时提供重新投影和重采样图像所需的计算能力。


为合适的任务选择合适的硬件

由于数据获取和准备通常占据推理任务运行时间的大部分,将这项工作分配给 GPU 会让系统中最昂贵的硬件去执行更适合 CPU 的任务。因此,我们将每个任务分为三个阶段,每个阶段匹配不同的硬件配置:

OlmoEarth 平台将这些阶段分布到多台机器上,同时保持 GPU 的充分利用。多进程数据加载器持续为每个 GPU 提供数据,而完成的输出则直接流式传输到对象存储。


一个请求、数百个工作节点、数千个进程

OlmoEarth Run 是平台用于大规模推理任务的执行层,它将每个任务覆盖的地理区域划分为适合单个计算实例(工作节点)大小的分区,然后将这些分区进一步细分为更小的窗口,供 OlmoEarth 模型处理。由于每个窗口可以在独立的前向传播中单独处理,地图某一部分的工作无需等待另一部分完成。在实践中,一个州大小的区域可能变成大约一百个分区,而一个大陆规模的运行可能变成数千个分区。相邻分区有轻微重叠,我们在组装输出时协调这种重叠,以确保最终栅格中没有接缝出现。

由于分区是独立的,同一阶段可以同时在数千个计算实例上运行。我们最近使用这种方法生成了一张覆盖整个北美的野火风险图。在峰值时,该运行并行使用了约 19,600 个 CPU 和 994 个 GPU,网络吞吐量超过 168 GB/s。这种并行度将原本估计需要 4,737 小时的串行计算减少到约 30.5 小时的挂钟时间——加速比达到 155 倍。不过,扇出并非无限制。更多的工作节点会触及云配额限制,因此

📖 阅读原文 →