跳到正文
原文
a16z· @a16z · X·· 2026-09-04精选AI 评分66

World Labs 联创与 a16z 论 Atlas:新视角预测统一像素生成与重建

AI 导读

a16z 转发 World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 与 a16z 的 Martin Casado 关于空间智能世界模型 Atlas 的对话。

推荐理由

对话梳理了新视角预测为何能统一生成与重建,以及它对3D捕捉和机器人数据瓶颈的影响。

正文 · AI 翻译

World Labs 联合创始人李飞飞、Justin Johnson、Ben Mildenhall 以及 a16z 的 Martin Casado 谈 Atlas——一个面向空间智能的世界模型:

大语言模型建立在下一个词元预测之上,视频模型建立在下一帧预测之上,而 Atlas 建立在新视角预测之上。它是首个将像素生成与像素重建统一起来的模型——这两个问题在计算机视觉领域被分开研究了半个世纪。

实际效果是,数字化捕捉一个空间的 3D 表征所需的工作量降低了 50 到 100 倍。以前,要捕捉一个房间需要 100 到 300 张照片,而 Atlas 只需要三张。

在这次对话中,他们聊到了《黑客帝国》里那个慢动作镜头——当年需要上百台摄像机,如今三部 iPhone 就能拍出;那条让他们在五秒钟内押上整个公司的 Slack 消息;为什么机器人领域的瓶颈在于数据而非芯片;以及为什么新视角预测是 AI 完全问题。

00:00 开场

01:50 《黑客帝国》慢动作场景如今只需三部 iPhone

02:48 为什么新视角预测是基础原语

07:10 统一生成与重建

11:15 高斯泼溅成了瓶颈

14:17 密集捕捉过去意味着 300 张照片

17:30 为什么重建需要生成来填补空白

18:44 图像模型错过的 LLM 启示

23:39 让他们全力投入的那段视频

28:04 3D 设计 95% 的时间在改稿

30:50 机器人领域的问题是数据,不是芯片

32:48 为什么机器人策略不能像图像模型那样训练

34:44 当模拟器变成规划器

36:45 冻结时间需要充满运动的画面

40:57 为什么新视角预测是 AI 完全问题

42:43 大自然给了动物眼睛,却没给它们树

YouTube: piped.video/watch?v=qn1QDDBn…

@drfeifei @jcjohnss @BenMildenhall @theworldlabs @martin_casado

来源:a16z · x.com