NVIDIA Research

NVIDIA Research,在人工智能、计算机图形学、机器人学与加速计算领域进行前沿探索,不断突破 GPU 技术的可能性边界。

NVIDIA提出PDD:用并行解码蒸馏将视频生成推理加速至4-8步

NVIDIA Research提出PDD(并行解码蒸馏)方法,将扩散/流匹配模型的推理步数从50步降至4-8步,在LTX-2.3、Wan2.1 14B和Qwen-Image上达到SOTA。方法核心是用单次前向传播预测多个去噪步骤,而非传统蒸馏的合并成大步更新,训练时通过可变block size支持推理时灵活调整NFE。实测视频多样性显著提升,页面附带多组对比视频demo。
评论点赞收藏10 天前

基于 ReSTIR 的实时细节层级渲染

NVIDIA Research 在 SIGGRAPH 2026 提出一种支持几何细节层级(LoD)切换的 ReSTIR 实时渲染方法,通过表面点映射实现不同拓扑网格间的样本复用,解决了此前 ReSTIR 在 LoD 切换时样本复用失效的问题。
评论点赞收藏11 天前

ARDY:用于人体动作生成的自回归扩散模型

NVIDIA提出ARDY,首个支持实时流式生成的3D人体动作扩散模型。结合自回归Transformer与混合表征,实现长程文本提示与运动学约束控制。已在Unitree G1机器人上验证实时交互控制能力,填补了离线生成与实时合成间的性能空白。
评论点赞收藏32 天前

通过 Ogita–Aishima 迭代精炼在 GPU 上实现混合精度 SVD

NVIDIA Research提出基于Ogita–Aishima迭代 refinment 的混合精度 SVD 算法,利用矩阵乘法特性优化 GPU 计算。该方法将 FP32 精度的 SVD 结果精炼至 FP64 精度,在 RTX PRO 6000 Blackwell 上相比原生 FP64 例程最高获得 5.2 倍加速,且精度相当。这对需要高性能数值线性代数的 HPC 和科学计算场景具有直接参考价值。
评论点赞收藏39 天前

英伟达 Nemotron 3 Ultra 发布:550B参数混合专家架构,开源模型与训练数据

英伟达发布 Nemotron 3 系列最强模型 Nemotron 3 Ultra,总参数量550B、激活参数55B,采用 MoE 混合 Mamba-Attention 架构与 LatentMoE 技术。核心亮点包括:支持 MTP 层实现原生投机解码加速推理,推理时可控制推理预算,预训练采用 NVFP4 精度,后训练结合 SFT、RL 和多教师在线蒸馏(MOPD)。推理吞吐量相比 GLM-5.1-754B 提升 5.9 倍、比 Kimi-K2.6-1T 提升 4.8 倍,上下文长度支持 1M tokens。英伟达同时开源了预训练/后训练/量化 checkpoint,以及代码、法律、专用知识等数据集和训练配方。
评论点赞收藏72 天前

Nemotron 3 Ultra:面向智能体推理的开放高效混合专家Mamba-Transformer模型

NVIDIA 发布 Nemotron 3 Ultra 技术报告,550B 总参数/55B 激活参数的混合专家 Mamba-Attention 模型,基于 NVFP4 精度训练 20 万亿 token,上下文长度扩展至 100 万 token。核心亮点:LatentMoE 架构、多 token 预测(MTP)、多教师策略蒸馏(MOPD)、推理预算控制,以及推理吞吐量相比 GLM-5.1/Kimi-K2.6/Qwen-3.5 等竞品最高提升约 6 倍,agentic 和推理基准精度持平。模型权重、训练数据和配方已在 HuggingFace 开源,包含代码、法律等专项预训练数据集。报告详细披露了架构配置、NVFP4 训练稳定性、两阶段预训练策略以及后训练对齐流程。
评论点赞收藏72 天前

VideoFDB:评估智能体全双工视听对话能力的基准测试

NVIDIA 研究团队推出 VideoFDB,首个评测全双工视听对话智能体的基准测试。核心看点:当前最强视觉-语音模型系统性忽略了对话中目光回避、停顿、副语言反馈等非语言信号。基于 237 段真实视频通话、11 类对话动态,评测发现两种系统性失败模式——"图像描述坍塌"(模型把视觉输入当作描述任务而非对话)和"视觉流忽略"(视听输出与纯音频几乎相同)。1 FPS 的视频帧率无法捕捉 1-2 秒内的非语言信号;级联式语音转虚拟形象管线延迟 2.8-3.5 秒,无法在用户说话中插入非语言提示。最佳模型 MiniCPM-o 4.5 仅达人类流畅度 73%,对话流利度差距最大(3.54 vs 人类 4.20)。该工作为交互式具身 AI 提供了明确的问题定义与下一步研究方向。
评论点赞收藏75 天前

Déjà View:循环Transformer实现多视图三维重建

NVIDIA联合多所高校提出Déjà View,用同一个Transformer块循环处理多视图图像完成三维重建,仅1.17亿参数即在五项基准测试上超越参数规模大8-10倍的前馈式模型,同时计算量更低。传统方法通过堆叠越来越多独立层来提升重建质量,而Déjà View发现这些层实际上在重复类似运算,于是将迭代过程显式化——单个循环块反复精炼特征,训练时支持不同的迭代步数,推理时用户可根据算力需求自由调节。该方法为多视图三维重建提供了一种更高效的架构思路。
评论点赞收藏75 天前

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA研究实验室发布Cosmos 3,一个统一文本、图像、视频、音频和动作的全模态世界模型,可同时支持视觉语言推理、图像生成、音视频生成、机器人策略规划、前向/反向动力学模拟等多项任务。模型在机器人、智能空间、自动驾驶等基准测试中排名开源第一,并提供benchmark数据与交互式demo。对物理AI/具身智能研究者有直接参考价值,但页面为官方产品展示,缺乏个人经验与讨论入口。
评论点赞收藏75 天前

PiD:基于像素扩散的快速高分辨率潜解码器

NVIDIA 提出 PiD(Pixel Diffusion Decoder),将潜空间解码改造为条件像素扩散,统一解码与超分流程,实现 512×512 潜变量直接解码至 2048×2048 像素,消费级 RTX 5090 上亚秒级完成、峰值显存仅 13GB,速度比级联扩散超分管线快约 6 倍。核心创新包括:噪声感知适配器注入含噪潜变量,支持提前终止 LDM 主干解码;DMD2 蒸馏将推理压缩至 4 步;兼容 VAE 及 SigLIP/DINOv2 等语义潜空间。定量对比中 PiD 在视觉偏好率和延迟上均优于 Real-ESRGAN、SeedVR2、TSD-SR 等基线。
评论点赞收藏82 天前

Lyra 2.0:可探索的生成式3D世界

英伟达研究团队提出Lyra 2.0框架,通过生成摄像机可控的3D漫游视频并前馈重建为3D场景,让用户像玩游戏一样探索AI生成的3D世界。核心突破是解决了长轨迹生成中的两大难题:"空间遗忘"(离开后再回来时场景错乱)和"时间漂移"(逐帧累积变形)。方法上,用逐帧3D几何做信息路由,只检索相关历史帧建立密集对应,不依赖模型记忆场景;同时用自增强训练让模型学会纠正自己的生成偏差。输出的3D高斯和网格可直接导出到Isaac Sim等物理引擎,用于具身AI仿真和机器人导航。论文、权重和推理代码已开源。技术深度扎实,适合对3D生成、计算机视觉或具身AI仿真感兴趣的技术读者。
评论点赞收藏104 天前

RoboLab:机器人及策略无关的高保真仿真基准测试平台

NVIDIA 研究团队推出 RoboLab——一个与机器人型号和具体策略无关的高保真仿真基准测试平台,专门用于评估任务通用型机器人策略的真实世界泛化能力。核心特色:支持通过物理排列物体生成场景、通过自然语言指令生成任务,既可手动操作也可借助 LLM 智能体自动完成;评测体系覆盖视觉识别(颜色、语义、尺寸)、物体关系理解(时间、数量、空间)和程序推理(可操作性、重新定向)三个能力轴,共 120 个任务,分三个难度等级;引入神经后验估计(NPE)量化环境参数对策略成功率的影响,发现腕部相机参数最为敏感。该工作已被 RSS 2026 接收,提供交互式结果仪表盘和多语言指令变体评测,所有任务库与机器人型号和策略无关。
评论点赞收藏115 天前

Nemotron-Cascade 2:利用级联强化学习与多域在策略蒸馏进行大模型后训练

NVIDIA 发布 Nemotron-Cascade 2,一个仅 30B MoE(3B 激活参数)的开源模型,在 IMO 2025、IOI 2025 和 ICPC World Finals 2025 三大顶级竞赛中均拿下金牌,以 20 倍参数优势逼近 DeepSeek-V3.2-Speciale-671B 等前沿大模型。论文核心贡献是在 Cascade RL 框架中引入多域在策略蒸馏(MOPD),在数学推理、代码推理、指令跟随、长上下文和智能体任务上全面超越 Qwen3.5-35B-A3B 和更大规模的 Nemotron-3-Super-120B。AIME 2025 达到 92.4(TIR 模式下 98.6),LiveCodeBench v6 达 87.2,SWE Verified 50.2。模型权重和 SFT/RL 训练数据全部开源,为后续级联强化学习研究提供了可复现的技术路线参考。
评论点赞收藏142 天前

Kimodo:基于700小时光学动捕数据训练的运动扩散模型

NVIDIA 发布 Kimodo,一个在 700 小时高质量光学动捕数据上训练的运动扩散模型。核心看点:通过文本提示和全套运动学约束(全身关键帧、稀疏关节位置/旋转、2D 路径等)即可精确生成逼真人体运动,大幅降低机器人训练数据的获取门槛。技术架构采用两阶段去噪器,将根轨迹与身体运动解耦预测,有效减少浮空、脚滑等常见伪影。研究还开源了运动创作 Demo 和 Python API,生成结果可导出到 ProtoMotions、Mujoco 等框架用于训练物理策略。对于机器人、动画、仿真领域的研究者和从业者来说,这是一个有实际价值的工具级成果,附有丰富的视频演示和代码资源。
评论点赞收藏150 天前

英伟达发布 Nemotron 3 Super 开源大模型

英伟达开源 Nemotron 3 Super,120B 总参数/12B 激活的 MoE 混合架构模型,首次集成 LatentMoE 提升精度、MTP 层实现原生推测解码加速推理、NVFP4 精度预训练。8K 输入/64K 输出场景下推理吞吐达 GPT-OSS-120B 的 2.2 倍、Qwen3.5-122B 的 7.5 倍,支持 100 万 token 上下文并在 RULER 长文本评测上超越两者。同步开源预训练/后训练/量化检查点、训练数据集及模型配方。
评论点赞收藏156 天前

NVIDIA PersonaPlex:支持任意角色与声音的自然对话式AI

NVIDIA打破对话AI的两难选择:传统级联系统(ASR→LLM→TTS)可自定义声音和角色但对话生硬,全双工模型(如Moshi)对话自然却锁定单一声音。PersonaPlex首次同时实现两者——通过语音嵌入+文本提示混合驱动,支持任意角色/声音设定,保留打断、回馈、自然话轮转换等实时互动能力。基于7B参数的Moshi架构,在Fisher英语语料(1217小时真实对话)+ 合成客服/助手数据(2250小时)上训练,核心发现包括:从预训练权重起步仅需不到5000小时定向数据即可实现任务跟随;真实录音与合成数据可解耦融合,用真实语音模式补足合成声音的行为丰富度;在太空紧急场景等训练分布之外的对话中展现出泛化能力。代码MIT开源,模型采用NVIDIA Open Model License。对做语音交互、对话系统、AI基础设施的读者有实质参考价值。
评论点赞收藏181 天前

面向NVFP4推理精度恢复的量化感知蒸馏技术

一篇面向NVFP4低精度量化的大模型推理精度恢复技术报告。NVIDIA团队提出量化感知蒸馏(QAD),用全精度教师模型的KL散度损失来训练NVFP4量化学生模型,而非传统QAT的交叉熵任务损失。实验表明,对于经过SFT、RL和多模型合并的现代LLM管线,QAD能稳定恢复至接近BF16精度水平,而传统QAT在RL训练后的模型上会显著破坏已有能力。QAD还对数据覆盖不完整有较好的鲁棒性。覆盖Llama Nemotron Super、Nemotron Nano、AceReason等多个模型系列,在AIME25、GPQA-D等推理基准上有详细对比。
评论点赞收藏189 天前

稀疏计算的智能之道:LatentMoE 以更少算力实现更高精度

NVIDIA 研究团队提出 LatentMoE,一种面向真实推理成本的 MoE 架构改进。标准 MoE 宣称"激活少量专家、低成本获得大参数",但实际部署中成本大头在内存搬运和跨 GPU 通信,而非单纯计算量。LatentMoE 的思路是在路由路径前后各加一层共享线性投影:先将隐藏层 d 维压缩到更低维度的潜在空间 ℓ,再进行专家路由和计算,最后投影回原维度。这大幅减少了每 token 需搬运的专家权重量和跨 GPU 通信量,省下的资源用于增加专家数量和 top-k,从而在相近服务成本下提升模型精度。论文展示了在 95B 参数 Transformer MoE 以及混合 Mamba-Attention MoE 上的提升,并已被用于 NVIDIA Nemotron-3 Super 和 Ultra 系列模型。在万亿参数规模的投影分析中,LatentMoE 在相同精度下预计可达标准 MoE 的 3.5 倍加速。适合关注大模型推理效率、MoE 架构设计的工程师和研究人员阅读。
评论点赞收藏200 天前

ToolOrchestra:通过高效模型与工具编排提升智能水平

NVIDIA发布ToolOrchestra,一种训练小型协调模型编排多种工具和专用LLM的方法。核心看点:仅8B参数的Nemotron-Orchestrator-8B在人类终极考试(HLE)上取得37.1%得分,超越GPT-5(35.1%),成本仅为GPT-5的约30%、速度快2.5倍。该方法通过强化学习联合优化结果、效率和用户偏好奖励,让轻量模型灵活调用搜索、代码解释器、数学/代码专用模型以及GPT-5等通用大模型。在FRAMES和τ²-Bench基准上也大幅领先GPT-5。分析表明该模型工具调用更均衡,不偏向特定工具,且能泛化到训练时未见过的工具。论文还披露了扩展性和领域覆盖等局限。这项研究说明用小模型编排多样化工具,比依赖单一超大模型更高效、更有效。
评论点赞收藏219 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。