PyTorch Website

RSS: https://docs.pytorch.org/feed.xml
PyTorch 官方文档,开源深度学习框架的教程、API 参考与指南。

PyTorch:一种参考语言

PyTorch 既是参考语言也是实现语言。作者提出用 PyTorch 代码作为参考实现,LLM 生成显式的前向-反向版本用于优化,并用等价性验证器确保两者一致。这种模式在大规模训练中平衡了灵活性与性能。
评论点赞收藏19 天前

PyTorch 团队 AI 编码实操手册(2026 年 5 月版)

PyTorch 核心维护者 Edward Yang 撰写了这份面向 AI 编码时代的团队实操手册。文章围绕 PyTorch 代码库如何与 AI 编程 agent 协作,提出了从保守到激进的三档规范:最保守端要求人类逐行审阅并主导评审对话;中间档是批量 AI PR 需团队整体认可 ROI;最激进档允许无人审阅的代码(slop),但必须封装在良好定义的组件边界内、有可验证输出、且只能放在外部仓库。文章还预告了 RADAR 自动审核、AI Lint 检查、内部测试自动化为开源测试用例、代码所有者冷却机制等一系列即将落地的工具和流程改革。这不是空泛的趋势解读,而是全球最知名深度学习框架之一内部关于 AI 生成代码的真实决策记录和争议讨论,对任何面临 AI 代码涌入的工程团队都有直接参考价值。
评论点赞收藏75 天前

CUDA 缓存分配器中的碎片化何时发生?

PyTorch 核心开发者 Edward Yang 通过可运行代码示例,逐层拆解 CUDA 缓存分配器碎片化的真实成因与边界条件。核心结论:不使用 expandable segments 时,cudaMalloc 创建的各段无法合并,分配顺序不当会导致严重内存浪费(同样工作可差一倍显存);启用 expandable segments 后,所有物理页映射在同一虚拟地址范围,释放后可完全合并为新请求服务,分配顺序不再重要——但前提是所有块都被释放,存活块仍会钉住碎片。文中还指出 1 MiB 边界陷阱:分配跨过该阈值会落入不同内存池,破坏共享。对 LLM 推理服务中 KV cache 压榨显存的场景尤其有实操价值。
评论点赞收藏75 天前

PyTorch 开发者日志

核心工程视角的 PyTorch 近况一览:ezyang 等一线开发者近期发布了 12 余篇高密度技术日志,覆盖 CUDA 缓存分配器碎片成因分析、AI 编码代理协作策略、Dynamo 嵌套图断裂优化(减少最多 67% 图断裂)、分布式通信 Python 优先方案(6 倍 RL 训练加速)、Diffusers 结合 torch.compile 实战指南(Flux 加速 1.5 倍且编译耗时降 7 倍)、CPython C++ 开发笔记、mergedog PR 自动化工具、调度器工作原理详解等。每篇均有实质技术讨论和一手经验,非营销废话,附 AI 辅助声明。适合关注 PyTorch 底层进展的框架开发者和高级用户追踪最新动向。
评论点赞收藏97 天前

PyTorch 广播语义

PyTorch 官方文档详解广播(Broadcasting)机制:执行逐元素运算时,系统自动将形状不同的张量扩展为相同尺寸,无需复制数据。核心规则是从尾部维度依次对齐比较,各维度必须满足相等、其中之一为1或该维度不存在。文档给出完整可广播性判定流程、结果尺寸计算方法(取各维最大值)、in-place 操作限制(不允许改变被操作张量的形状),以及向后兼容说明——旧版将不等形状但元素总数相等的张量视为一维计算,新版改用广播后结果形状可能不同。纯技术参考文档,适合需精确理解张量运算规则的 PyTorch 使用者查阅。
评论点赞收藏163 天前

PyTorch 后端模块 API 参考

PyTorch 官方 torch.backends 模块的完整 API 参考文档,列出 CPU、CUDA、cuDNN、MPS、MKL 等全部后端子模块的可用接口、函数签名和参数说明。涵盖 CUDA 矩阵运算精度控制(TF32、fp16/bf16 约简)、cuFFT 计划缓存管理、BLAS 与线性代数库选择、Flash Attention / Memory-Efficient / cuDNN SDPA 后端的启用与检测,以及 ROCm 环境的 Flash Attention 后端切换等。纯 API 规范文档,无教程讲解、无使用经验、无观点分析,适合用作查阅参考。
评论点赞收藏429 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。