HeyGen × Google Cloud:将Avatar IV带到TPU上
HeyGen将18B+参数的Avatar IV视频生成模型移植到Google Cloud Trillium(v6e)TPU上,通过torchax和XLA实现1.86倍实时流式加速。工程团队在8芯片mesh上使用了FSDP和Ulysses序列并行,对all-to-all通信进行流水线化,对齐稀疏注意力块大小以消除mask填充,并用预计算的柯西-施瓦茨上界绕过softmax串行依赖。这些自定义Pallas kernel和编译器优化在上线前通过了双层质量门控,确保像素级输出字节一致或数学等价。
