NVIDIA 成为 AI 产业观察信号
NVIDIA Research Shapes Physical AI: Physical AI — the engine behind modern robotics, self-driving cars and smart spaces — relies on a mix of neural graphics, synthetic data generation, physics-based simulation, reinforce

正文
物理 AI——现代机器人、自动驾驶汽车和智能空间背后的引擎——依赖于神经图形学、合成数据生成、基于物理的仿真、强化学习和 AI 推理的组合。这一组合非常适合 NVIDIA Research 的集体专长;近 20 年来,这支全球团队一直在推动如今正在融合的 AI 与图形学领域发展。
因此,在 SIGGRAPH 这一顶级计算机图形学大会上,NVIDIA Research 领导层将在温哥华举行的大会期间(截至 8 月 14 日星期四)发表特别演讲,重点介绍支撑物理 AI 和空间 AI 的图形与仿真创新。
NVIDIA AI research 副总裁 Sanja Fidler 表示:“AI 正在推进我们的仿真能力,而我们的仿真能力也正在推动 AI 系统进步。两者之间存在一种真实而强大的耦合,而这种组合并不是很多人都拥有的。”
在 SIGGRAPH 上,NVIDIA 正在发布面向物理 AI 的新软件库——包括用于大规模世界重建的 NVIDIA Omniverse NuRec 3D Gaussian splatting 库、面向 vision AI 的 NVIDIA Metropolis 平台更新,以及 NVIDIA Cosmos 和 NVIDIA Nemotron 推理模型。Cosmos Reason 是一款新的用于物理 AI 的推理型视觉语言模型,它让机器人和 vision AI agents 能够利用先验知识、物理理解和常识,像人类一样进行推理。
其中许多创新都源自公司全球研究团队的突破。该团队将在本次大会上展示十多篇论文,内容涵盖神经渲染、实时路径追踪、合成数据生成和强化学习等进展——这些能力将为下一代 physical AI 工具提供支撑。
Physical AI 的开发始于构建高保真、物理上准确的 3D 环境。没有这些逼真的虚拟环境,开发者就无法在模拟中训练包括人形机器人在内的先进 physical AI 系统,因为机器人在虚拟训练中学到的技能无法足够好地迁移到现实世界。
可以想象一台农业机器人以恰到好处的力度从树上摘下桃子而不造成挤压,或者一台制造机器人在一台每毫米都至关重要的机器上组装微型电子元件。
“Physical AI 需要一个感觉真实的虚拟环境,一个机器人可以在其中通过反复试错安全学习的平行宇宙,”NVIDIA 研究副总裁 Ming-Yu Liu 说。“要构建这个虚拟世界,我们需要实时渲染、计算机视觉、物理运动仿真、2D 和 3D 生成式 AI,以及 AI 推理。这些正是 NVIDIA Research 近二十年来一直深耕并擅长的领域。”
NVIDIA 自 2006 年研究组织成立以来,在光线追踪和实时计算机图形领域持续取得突破性研究成果,这一积累在实现物理 AI 模拟所需的真实感方面发挥着关键作用。大量渲染工作同样由 AI 模型驱动——这一领域被称为神经渲染(neural rendering)。
NVIDIA 图形研究副总裁兼 Real-Time Graphics Research 组负责人 Aaron Lefohn 表示:“我们的核心渲染研究推动了用于训练先进物理 AI 系统的逼真虚拟世界的构建,而 AI 也在反过来帮助我们从图像生成这些 3D 世界。我们现在已经到了这样一个阶段:可以将图片和视频——任何人都能拍摄到的一种易于获取的媒体形式——快速重建为虚拟 3D 环境。”
这项关于正向渲染(将 3D 转换为 2D)和逆向渲染(将 2D 转换为 3D)的基础研究,与多年用于模拟物理运动的研究和技术创新相辅相成,其中包括 Fidler 的 Spatial Intelligence Lab 所开展的工作。该实验室今天发布了 ViPE(Video Pose Engine),这是一个与 Dynamic Vision Lab 和 NVIDIA Isaac 团队合作开发的、面向视频的 3D 几何标注管线,可基于业余录制、行车记录仪或电影镜头等素材估计相机运动,并生成详细的深度图。
在生成式 AI 领域,Liu 领导的 Deep Imagination Research 团队是 NVIDIA Research 中率先探索计算机视觉、Transformer 以及视觉生成式 AI 模型的团队之一,这些模型使物理 AI 系统能够理解并预测世界的未来状态——例如汽车闯红灯,或者玻璃杯离桌沿太近时可能出现的结果。
这些举措为 NVIDIA Cosmos 奠定了基础。Cosmos 是今年早些时候推出的平台,旨在借助世界基础模型、后训练库以及加速的数据处理与整理流水线,推动物理 AI 开发提速。
NVIDIA 研究人员将在 SIGGRAPH 上展示仿真、AI 驱动渲染以及 3D 内容生成方面的进展,这些技术有望应用于虚拟世界创建、机器人开发和自动驾驶汽车训练。
其中一篇论文聚焦于如何从 2D 图像或视频中重建具备物理感知能力的 3D 几何结构。虽然许多模型可以根据视频素材估算出一个 3D 物体,但生成的 3D 形状往往缺乏结构稳定性。即便在视觉上与真实物体十分接近,生成出来的形状也可能存在比例略显不均或细节缺失的问题,从而影响其物理真实性。
例如,基于 2D 影像构建的一把椅子的 3D 仿真模型,在放入物理准确的模拟环境后可能会坍塌,因为 AI 模型做的是 3D 结构的视觉估算,而不是基于真实测量值。本文提出的方法有助于确保生成的 3D 形状复现真实世界的物理规律,从而避免这一问题——并支持为物理 AI 训练创建虚拟世界。
您的浏览器不支持 HTML5 视频。
另一篇论文提出了一种让模拟角色通过物理上准确的运动“活”起来的技术。研究人员将一个运动生成器与基于物理的跟踪控制器相结合,为复杂动作生成逼真的合成数据,例如跑酷选手的特技动作。
这些数据有助于开发虚拟角色,或训练现实世界中的人形机器人获得敏捷的运动技能,而这类技能在现实世界训练数据中并不常见,从而拓展机器人能够完成的物理动作范围,例如穿越复杂地形以支持应急响应。
另外一些论文则着手处理光照和材料模拟的复杂性。
一个项目展示了艺术家如何创建 AI 助手,以增强材质细节。它借助扩散模型和可微分的基于物理的渲染器,为创作者提供了一种简便方式,能够在 3D 对象表示之上修改材质纹理贴图,从而通过简单的文本提示,创建更丰富、更逼真的虚拟世界。
团队演示了该模型如何被用来快速添加逼真的物体细节,例如风化或老化痕迹;而使用传统渲染方法创建这些细节往往非常耗时。这些物体可以充实虚拟环境,用于游戏等创意应用,也可用于在仿真中训练机器人和自动驾驶汽车等物理应用。
在光照模拟领域,另一篇 SIGGRAPH 论文针对可微分渲染中的一个挑战,提出了一种稳健的可微分可见性查询,使得能够更快、更准确地从图像和视频中重建 3D 几何。
这篇论文是 NVIDIA Research 的一个例子,它将正向渲染和逆向渲染结合起来,能够快速提取虚拟世界中的参数,而这些参数对于使用合成数据集准确训练 physical AI 模型至关重要。
欢迎观看 Fidler、Lefohn 和 Liu 在 SIGGRAPH 上的特别演讲,并在大会期间通过加入 NVIDIA 了解更多图形与仿真创新如何协同推动工业数字化;本次会议将持续至 8 月 14 日星期四。
AI解读
这是一条雷达解读:它可能反映 AI 产品、开发者工具、模型基础设施或研究方向的新变化。
对营销 / 内容创作者来说,可以作为后续选题、产品观察或技术调研的线索。
建议打开原文核对细节,并观察是否有同类信号在其他来源重复出现。