World Labs发布Atlas:用"新视角预测"统一像素生成与重建,3张照片即可数字化捕捉3D空间

新视角预测是Atlas的核心,使我们能够将像素级的生成与重建统一起来。我和@jcjohnss、@BenMildenhall以及@martin_casado深入探讨了Atlas——我们最新发布的空间智能世界模型——中一些最令人振奋的技术创新!

a16z (@a16z)
World Labs联合创始人李飞飞、贾斯汀·约翰逊、本·米尔登霍尔,以及a16z的马丁·卡萨多就Atlas这一面向空间智能的世界模型展开讨论:

大语言模型建立在“下一个词元预测”之上;视频模型建立在“下一帧预测”之上。而Atlas则基于“新视角预测”,它是首个将像素生成与像素重建统一起来的模型——这两个问题在计算机视觉领域曾被长期割裂,长达半个世纪之久。

实际效果是,数字化获取一个空间的3D表征所需的工作量降低了50至100倍。过去,仅拍摄一间房间就需要100至300张照片,而Atlas只需三张即可完成。

在这次对话中,他们聊到了《黑客帝国》中的慢动作镜头——当年动用了数百台相机,如今仅靠三部iPhone就能实现;聊到那条一夜之间让他们在短短五秒内决定孤注一掷的Slack消息;还谈到为什么机器人技术的瓶颈在于数据而非芯片,以及新视角预测堪称“AI完备”的理由。

00:00 导语
01:50 《黑客帝国》的慢动作场景如今只需三部iPhone
02:48 为何说新视角预测才是基础原语
07:10 如何统一生成与重建
11:15 高斯点云成为瓶颈
14:17 曾经的密集采集意味着要拍300张照片
17:30 为什么重建需要生成来填补空白
18:44 图像模型错过的LLM经验教训
23:39 那段让他们下定决心全力投入的视频
28:04 3D设计中95%都是反复修改
30:50 机器人领域的症结在数据,而非芯片
32:48 为什么不能像训练图像模型那样训练机器人策略
34:44 当仿真器成为规划器之时
36:45 “时间冻结”特效要求画面充满动态元素
40:57 为何说新视角预测是AI完备的
42:43 大自然赋予动物眼睛,却未赐予树木

YouTube:yewtu.be/watch?v=qn1QDDBn…

@drfeifei @jcjohnss @BenMildenhall @theworldlabs @martin_casado 视频
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论