World Labs 联创与 a16z 论 Atlas:新视角预测统一像素生成与重建
a16z 转发 World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 与 a16z 的 Martin Casado 关于空间智能世界模型 Atlas 的对话。
对话梳理了新视角预测为何能统一生成与重建,以及它对3D捕捉和机器人数据瓶颈的影响。
World Labs 联合创始人李飞飞、Justin Johnson、Ben Mildenhall 以及 a16z 的 Martin Casado 谈 Atlas——一个面向空间智能的世界模型:
大语言模型建立在下一个词元预测之上,视频模型建立在下一帧预测之上,而 Atlas 建立在新视角预测之上。它是首个将像素生成与像素重建统一起来的模型——这两个问题在计算机视觉领域被分开研究了半个世纪。
实际效果是,数字化捕捉一个空间的 3D 表征所需的工作量降低了 50 到 100 倍。以前,要捕捉一个房间需要 100 到 300 张照片,而 Atlas 只需要三张。
在这次对话中,他们聊到了《黑客帝国》里那个慢动作镜头——当年需要上百台摄像机,如今三部 iPhone 就能拍出;那条让他们在五秒钟内押上整个公司的 Slack 消息;为什么机器人领域的瓶颈在于数据而非芯片;以及为什么新视角预测是 AI 完全问题。
00:00 开场
01:50 《黑客帝国》慢动作场景如今只需三部 iPhone
02:48 为什么新视角预测是基础原语
07:10 统一生成与重建
11:15 高斯泼溅成了瓶颈
14:17 密集捕捉过去意味着 300 张照片
17:30 为什么重建需要生成来填补空白
18:44 图像模型错过的 LLM 启示
23:39 让他们全力投入的那段视频
28:04 3D 设计 95% 的时间在改稿
30:50 机器人领域的问题是数据,不是芯片
32:48 为什么机器人策略不能像图像模型那样训练
34:44 当模拟器变成规划器
36:45 冻结时间需要充满运动的画面
40:57 为什么新视角预测是 AI 完全问题
42:43 大自然给了动物眼睛,却没给它们树
YouTube: piped.video/watch?v=qn1QDDBn…
@drfeifei @jcjohnss @BenMildenhall @theworldlabs @martin_casado
来源:a16z · x.com