NVIDIA Research

NVIDIA Research,在人工智能、计算机图形学、机器人学与加速计算领域进行前沿探索,不断突破 GPU 技术的可能性边界。

SWE-Serve:面向生产推理服务的智能体工程基准测试

NVIDIA Research 发布 SWE-Serve 基准,将 SGLang 真实推理系统工程工作(模型集成、API、缓存、GPU kernel)转成 53 个可验证编码任务,用 11 个模型 × 31 种配置各跑 3 轮。 榜首 Claude Opus 5 与 Claude Sonnet 5 Pass@1 均为 75%,前者成本 $17/配置,后者 $12;DeepSeek V4 Flash、GLM-5.2 等多数模型在 46–64% 区间。 文章重点不是模型排名本身,而是把"agent 能否完成生产级推理系统工程"作为可量化指标:每个任务都有功能测试 + 回归测试双重验证,agent 闭卷(禁公网、禁上游仓库),仅给任务说明和起始仓库,评分只看 verifier 结果而非代码匹配参考解。 对关注 AI 编程 agent 工程能力、推理系统(SGLang/vLLM 类框架)以及"模型能写生产级系统代码吗"这一争论的科技读者,有明确讨论入口:不同模型的成本-通过率权衡、闭卷条件下 75% vs 35% 的巨大差距、以及"通过验证器 ≠ 代码可合并"的局限。
评论点赞收藏5 天前

Nemotron-H:一个高精度、高效率的混合 Mamba-Transformer 模型家族

NVIDIA 发布 Nemotron-H 系列混合 Mamba-Transformer 模型,含 8B 与 47/56B 基础/指令/视觉语言模型,主打在相近推理成本下提升智能。 核心亮点:用 Mamba 层替换大部分自注意力,长上下文推理速度可达纯 Transformer 同尺寸模型的约 3 倍;56B 模型以 20T tokens、FP8 精度完成预训练,被认为是大规模 FP8 预训练公开案例之一;通过 miniPuzzle 蒸馏压缩出 47B 模型,可在 RTX 5090 上用 FP4 跑约百万 token 上下文;56B 模型还用作 Cosmos-Reason 1 物理 AI VLM 的骨干。 提供与 Qwen-2.5、Llama-3.1、DeepSeek-V3 等的对比基准,显示在 MMLU、数学、代码、常识及长思考推理上具有竞争力。
评论点赞收藏7 天前

DLSS 5:生成式神经渲染

NVIDIA 发布 DLSS 5,首次从"重建"转向"生成"最终画面,在 RTX 50 系列显卡上实现 4K 实时生成式渲染。核心技术是一步像素空间扩散模型,以渲染帧、运动矢量、时序状态和艺术方向值为条件,训练时通过渲染器场景属性做一致性约束,保证生成结果忠于开发者意图。 生成式渲染不替代 PBR,而是补充传统渲染难以高效提供的真实世界外观知识,如皮肤次表面散射、树叶透光散射等。
评论点赞收藏21 天前

NVIDIA提出PDD:用并行解码蒸馏将视频生成推理加速至4-8步

NVIDIA Research提出PDD(并行解码蒸馏)方法,将扩散/流匹配模型的推理步数从50步降至4-8步,在LTX-2.3、Wan2.1 14B和Qwen-Image上达到SOTA。 方法核心是用单次前向传播预测多个去噪步骤,而非传统蒸馏的合并成大步更新,训练时通过可变block size支持推理时灵活调整NFE。实测视频多样性显著提升,页面附带多组对比视频demo。
评论点赞收藏56 天前

基于 ReSTIR 的实时细节层级渲染

NVIDIA Research 在 SIGGRAPH 2026 提出一种支持几何细节层级(LoD)切换的 ReSTIR 实时渲染方法,通过表面点映射实现不同拓扑网格间的样本复用,解决了此前 ReSTIR 在 LoD 切换时样本复用失效的问题。
评论点赞收藏57 天前

ARDY:用于人体动作生成的自回归扩散模型

NVIDIA提出ARDY,首个支持实时流式生成的3D人体动作扩散模型。结合自回归Transformer与混合表征,实现长程文本提示与运动学约束控制。 已在Unitree G1机器人上验证实时交互控制能力,填补了离线生成与实时合成间的性能空白。
评论点赞收藏77 天前

通过 Ogita–Aishima 迭代精炼在 GPU 上实现混合精度 SVD

NVIDIA Research提出基于Ogita–Aishima迭代 refinment 的混合精度 SVD 算法,利用矩阵乘法特性优化 GPU 计算。该方法将 FP32 精度的 SVD 结果精炼至 FP64 精度,在 RTX PRO 6000 Blackwell 上相比原生 FP64 例程最高获得 5.2 倍加速,且精度相当。 这对需要高性能数值线性代数的 HPC 和科学计算场景具有直接参考价值。
评论点赞收藏84 天前

英伟达 Nemotron 3 Ultra 发布:550B参数混合专家架构,开源模型与训练数据

英伟达发布 Nemotron 3 系列最强模型 Nemotron 3 Ultra,总参数量550B、激活参数55B,采用 MoE 混合 Mamba-Attention 架构与 LatentMoE 技术。 核心亮点包括:支持 MTP 层实现原生投机解码加速推理,推理时可控制推理预算,预训练采用 NVFP4 精度,后训练结合 SFT、RL 和多教师在线蒸馏(MOPD)。 推理吞吐量相比 GLM-5.1-754B 提升 5.9 倍、比 Kimi-K2.6-1T 提升 4.8 倍,上下文长度支持 1M tokens。英伟达同时开源了预训练/后训练/量化 checkpoint,以及代码、法律、专用知识等数据集和训练配方。
评论点赞收藏118 天前

Nemotron 3 Ultra:面向智能体推理的开放高效混合专家Mamba-Transformer模型

NVIDIA 发布 Nemotron 3 Ultra 技术报告,550B 总参数/55B 激活参数的混合专家 Mamba-Attention 模型,基于 NVFP4 精度训练 20 万亿 token,上下文长度扩展至 100 万 token。 核心亮点:LatentMoE 架构、多 token 预测(MTP)、多教师策略蒸馏(MOPD)、推理预算控制,以及推理吞吐量相比 GLM-5.1/Kimi-K2.6/Qwen-3.5 等竞品最高提升约 6 倍,agentic 和推理基准精度持平。 模型权重、训练数据和配方已在 HuggingFace 开源,包含代码、法律等专项预训练数据集。报告详细披露了架构配置、NVFP4 训练稳定性、两阶段预训练策略以及后训练对齐流程。
评论点赞收藏118 天前

VideoFDB:评估智能体全双工视听对话能力的基准测试

NVIDIA 研究团队推出 VideoFDB,首个评测全双工视听对话智能体的基准测试。核心看点:当前最强视觉-语音模型系统性忽略了对话中目光回避、停顿、副语言反馈等非语言信号。 基于 237 段真实视频通话、11 类对话动态,评测发现两种系统性失败模式——"图像描述坍塌"(模型把视觉输入当作描述任务而非对话)和"视觉流忽略"(视听输出与纯音频几乎相同)。 1 FPS 的视频帧率无法捕捉 1-2 秒内的非语言信号;级联式语音转虚拟形象管线延迟 2.8-3.5 秒,无法在用户说话中插入非语言提示。 最佳模型 MiniCPM-o 4.5 仅达人类流畅度 73%,对话流利度差距最大(3.54 vs 人类 4.20)。该工作为交互式具身 AI 提供了明确的问题定义与下一步研究方向。
评论点赞收藏120 天前

Déjà View:循环Transformer实现多视图三维重建

NVIDIA联合多所高校提出Déjà View,用同一个Transformer块循环处理多视图图像完成三维重建,仅1.17亿参数即在五项基准测试上超越参数规模大8-10倍的前馈式模型,同时计算量更低。 传统方法通过堆叠越来越多独立层来提升重建质量,而Déjà View发现这些层实际上在重复类似运算,于是将迭代过程显式化——单个循环块反复精炼特征,训练时支持不同的迭代步数,推理时用户可根据算力需求自由调节。 该方法为多视图三维重建提供了一种更高效的架构思路。
评论点赞收藏120 天前

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA研究实验室发布Cosmos 3,一个统一文本、图像、视频、音频和动作的全模态世界模型,可同时支持视觉语言推理、图像生成、音视频生成、机器人策略规划、前向/反向动力学模拟等多项任务。 模型在机器人、智能空间、自动驾驶等基准测试中排名开源第一,并提供benchmark数据与交互式demo。对物理AI/具身智能研究者有直接参考价值,但页面为官方产品展示,缺乏个人经验与讨论入口。
评论点赞收藏121 天前

PiD:基于像素扩散的快速高分辨率潜解码器

NVIDIA 提出 PiD(Pixel Diffusion Decoder),将潜空间解码改造为条件像素扩散,统一解码与超分流程,实现 512×512 潜变量直接解码至 2048×2048 像素,消费级 RTX 5090 上亚秒级完成、峰值显存仅 13GB,速度比级联扩散超分管线快约 6 倍。 核心创新包括:噪声感知适配器注入含噪潜变量,支持提前终止 LDM 主干解码;DMD2 蒸馏将推理压缩至 4 步;兼容 VAE 及 SigLIP/DINOv2 等语义潜空间。 定量对比中 PiD 在视觉偏好率和延迟上均优于 Real-ESRGAN、SeedVR2、TSD-SR 等基线。
评论点赞收藏128 天前

Lyra 2.0:可探索的生成式3D世界

英伟达研究团队提出Lyra 2.0框架,通过生成摄像机可控的3D漫游视频并前馈重建为3D场景,让用户像玩游戏一样探索AI生成的3D世界。 核心突破是解决了长轨迹生成中的两大难题:"空间遗忘"(离开后再回来时场景错乱)和"时间漂移"(逐帧累积变形)。方法上,用逐帧3D几何做信息路由,只检索相关历史帧建立密集对应,不依赖模型记忆场景;同时用自增强训练让模型学会纠正自己的生成偏差。 输出的3D高斯和网格可直接导出到Isaac Sim等物理引擎,用于具身AI仿真和机器人导航。论文、权重和推理代码已开源。技术深度扎实,适合对3D生成、计算机视觉或具身AI仿真感兴趣的技术读者。
评论点赞收藏149 天前

RoboLab:机器人及策略无关的高保真仿真基准测试平台

NVIDIA 研究团队推出 RoboLab——一个与机器人型号和具体策略无关的高保真仿真基准测试平台,专门用于评估任务通用型机器人策略的真实世界泛化能力。 核心特色:支持通过物理排列物体生成场景、通过自然语言指令生成任务,既可手动操作也可借助 LLM 智能体自动完成;评测体系覆盖视觉识别(颜色、语义、尺寸)、物体关系理解(时间、数量、空间)和程序推理(可操作性、重新定向)三个能力轴,共 120 个任务,分三个难度等级;引入神经后验估计(NPE)量化环境参数对策略成功率的影响,发现腕部相机参数最为敏感。 该工作已被 RSS 2026 接收,提供交互式结果仪表盘和多语言指令变体评测,所有任务库与机器人型号和策略无关。
评论点赞收藏161 天前

Nemotron-Cascade 2:利用级联强化学习与多域在策略蒸馏进行大模型后训练

NVIDIA 发布 Nemotron-Cascade 2,一个仅 30B MoE(3B 激活参数)的开源模型,在 IMO 2025、IOI 2025 和 ICPC World Finals 2025 三大顶级竞赛中均拿下金牌,以 20 倍参数优势逼近 DeepSeek-V3.2-Speciale-671B 等前沿大模型。 论文核心贡献是在 Cascade RL 框架中引入多域在策略蒸馏(MOPD),在数学推理、代码推理、指令跟随、长上下文和智能体任务上全面超越 Qwen3.5-35B-A3B 和更大规模的 Nemotron-3-Super-120B。 AIME 2025 达到 92.4(TIR 模式下 98.6),LiveCodeBench v6 达 87.2,SWE Verified 50.2。模型权重和 SFT/RL 训练数据全部开源,为后续级联强化学习研究提供了可复现的技术路线参考。
评论点赞收藏188 天前

Kimodo:基于700小时光学动捕数据训练的运动扩散模型

NVIDIA 发布 Kimodo,一个在 700 小时高质量光学动捕数据上训练的运动扩散模型。核心看点:通过文本提示和全套运动学约束(全身关键帧、稀疏关节位置/旋转、2D 路径等)即可精确生成逼真人体运动,大幅降低机器人训练数据的获取门槛。 技术架构采用两阶段去噪器,将根轨迹与身体运动解耦预测,有效减少浮空、脚滑等常见伪影。研究还开源了运动创作 Demo 和 Python API,生成结果可导出到 ProtoMotions、Mujoco 等框架用于训练物理策略。 对于机器人、动画、仿真领域的研究者和从业者来说,这是一个有实际价值的工具级成果,附有丰富的视频演示和代码资源。
评论点赞收藏196 天前

英伟达发布 Nemotron 3 Super 开源大模型

英伟达开源 Nemotron 3 Super,120B 总参数/12B 激活的 MoE 混合架构模型,首次集成 LatentMoE 提升精度、MTP 层实现原生推测解码加速推理、NVFP4 精度预训练。 8K 输入/64K 输出场景下推理吞吐达 GPT-OSS-120B 的 2.2 倍、Qwen3.5-122B 的 7.5 倍,支持 100 万 token 上下文并在 RULER 长文本评测上超越两者。 同步开源预训练/后训练/量化检查点、训练数据集及模型配方。
评论点赞收藏202 天前

NVIDIA PersonaPlex:支持任意角色与声音的自然对话式AI

NVIDIA打破对话AI的两难选择:传统级联系统(ASR→LLM→TTS)可自定义声音和角色但对话生硬,全双工模型(如Moshi)对话自然却锁定单一声音。 PersonaPlex首次同时实现两者——通过语音嵌入+文本提示混合驱动,支持任意角色/声音设定,保留打断、回馈、自然话轮转换等实时互动能力。 基于7B参数的Moshi架构,在Fisher英语语料(1217小时真实对话)+ 合成客服/助手数据(2250小时)上训练,核心发现包括:从预训练权重起步仅需不到5000小时定向数据即可实现任务跟随;真实录音与合成数据可解耦融合,用真实语音模式补足合成声音的行为丰富度;在太空紧急场景等训练分布之外的对话中展现出泛化能力。 代码MIT开源,模型采用NVIDIA Open Model License。对做语音交互、对话系统、AI基础设施的读者有实质参考价值。
评论点赞收藏226 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。