训练 Tessera 地空间基础模型中获得的运行型 HPC 经验 [pdf]
剑桥大学团队发布 Tessera 地空间基础模型系列的 HPC 运维报告。Tessera 将 Sentinel-1/2 时间序列压缩为全球 10m 像素的年度嵌入,已在生态、农业、气象等任务中广泛使用,推理产物达到 PB 级。 团队从剑桥自有 Intel Dawn 集群起步,先后接入 AMD MI300X/MI325X 开发者云、NVIDIA Isambard GH200 512 卡分配和 Zenith MI355X 预览系统,记录了一次次跨厂商迁移中的实际收益与坑点:Intel GPU 默认八逻辑设备调度易碎、oneCCL IPC 不可靠、ROCm 2 小时起环境、torch.compile 加速 1.46–1.60 倍、源卫星数据带宽成为推理瓶颈、Isambard 24 小时任务限制拖累长期训练、ARM64 NCCL 偶发挂起。 报告最终提出六项面向研究计算者的跨厂商建议,包括预装验证过的 PyTorch+MPI 镜像、版本化容器、预留多日窗口等。对关注 HPC、GPU 异构训练与大规模地理数据管道的工程师和研究者有直接参考价值。