Lei Mao's Log Book

RSS: https://leimao.github.io/atom.xml
Lei Mao 的个人博客,关于 AI、CUDA、深度学习与计算机科学的笔记。

PyTorch 异步断言:在 GPU 流上非阻塞验证

PyTorch 的 torch._assert_async 可在 GPU 流上异步执行断言,不会阻塞主机线程。文章提供了一个完整示例:在 Softmax 输出后验证概率和是否为 1.0,配合 torch.profiler 做 warmup/active 阶段 profiling,并展示触发失败时如何捕获 GPU 流同步错误。
评论点赞收藏47 天前

CUDA 共享内存 Swizzling:用异或重排避免 Bank 冲突

用 XOR 异或方式重排 CUDA 共享内存地址,避免矩阵转置时的 bank 冲突,性能优于传统 padding 方案。实测 8192×8192 矩阵转置,三种方法(有冲突、padding、swizzling)均通过正确性验证,swizzling 方案延迟最低。
评论点赞收藏47 天前

悬案

浙江省真实悬案改编的网络剧
评论点赞收藏55 天前

PyTorch 多进程推理中通过 CUDA IPC 共享模型权重

PyTorch 多进程推理时,模型权重默认会复制到每个进程的 GPU 显存中,容易导致显存耗尽。通过 model.share_memory 或 AOTInductor 的 load_constants 接口,可以让多个进程共享同一份权重,避免重复占用显存。 实测在 RTX 5080(16GB)上,用 24 个 worker 共享权重可以成功运行,而不共享的话显存不够。
评论点赞收藏60 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。