The Bot Company 与 Physical Intelligence 联合创始人在 Runway AI Summit 谈机器人落地与三年展望
The Bot Company 联合创始人兼 CTO Paril Jain 与 Physical Intelligence 联合创始人 Quan Vuong 在 Runway AI Summit 同台,讨论真实世界评测、机器人实地部署以及机器人技术三年后的走向。
The Bot Company 联合创始人兼 CTO Paril Jain 与 Physical Intelligence 联合创始人 Quan Vuong 在 Runway AI Summit 同台,讨论真实世界评测、机器人实地部署以及机器人技术三年后的走向。
Arena 将于 10/7 在新迁入的旧金山总部举办屋顶 Happy Hour 开放日,邀请研究者和开发者参加。活动面向 SF Tech Week 或 COLM 期间到访者及湾区 AI 从业者,提供 boba bar、轻食和饮品,名额有限需通过 Luma 注册申请。
Claude Sonnet 5.5 的 xHigh 推理档位进入 Code Arena WebDev 榜单,以 1786 分排名第 3,混合价格 $8/M tokens,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分,价格约为其 80%。
Claude Sonnet 5.5 以 xHigh 推理模式进入 Code Arena: WebDev,得分 1786 分排名第 3,混合价格 $8/M tokens。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。
推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。
Arena 发布文生图模型后训练研究,认为人类偏好奖励必要但不充分,偏好模型仍会奖励细节缺失、加入未要求内容等 reward-hacking 输出。
Arena 研究提出前沿图像模型后训练的复合奖励方案,认为人类偏好奖励必要但不充分,偏好模型仍可能奖励细节缺失、引入未请求内容等 reward-hacking 行为。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 公布 Claude Sonnet 5.5(Max)首次进入 Agent Arena 即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点;在 Chat 分类中以 +15.6% 位列第 1,高于 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。
Arena 上线 Agent Arena 帕累托前沿(Pareto frontier)实时结果页面,可在 arena.ai/leaderboard/agent/overall/pareto 查看。该页面展示智能体在整体维度上的实时排名与帕累托前沿分布。
Anthropic 的 Claude Sonnet 5.5(Max)在 Agent Arena 首次上榜即位列第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,而此前系统的通过率低于 3%。该模型在 NVIDIA 的全双工 AI 视频基准上排名第一,并被称作首个 Human Interaction Model(HIM)。
fal 上线 Black Forest Labs 最新图像模型 FLUX 3 的 API,提供文生图与图像编辑两个入口。据 fal 介绍,该模型可生成原生 2K 和 4K 的细节丰富、构图良好的图像,具备精确的布局控制和改进的文字渲染能力。
Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。
推荐理由:FLUX 3 Image 在 fal 上线,列出原生 2K/4K 生成与多参考图编辑等能力,可据此判断图像编辑工作流的变化。
fal 推出 Recast,可一键替换视频中的角色:上传一段现有视频和一张新角色的参考照片,即可在保留原始运动、镜头运动、剪辑和音频的前提下更换出镜人物。该功能由 H3 Max 驱动,fal 称其在整体质量、提示词理解和美学上优于领先视频模型。用户可在 fal 平台 minimax/h3-max/recast 页面试用,用于生成角色变体或为不同受众改编广告素材,无需重新拍摄。
fal 发布 fal Recast,上传一段现有视频加一张新角色的参考照片,即可一键替换画面中的人物。官方称 Recast 会保留原视频的运动、镜头运动、剪辑和音频,可用于生成角色变体、为不同受众改编广告素材而无需重新拍摄。该功能由 H3 Max 驱动,fal 称其在整体质量、提示词理解和美学上优于主流视频模型。
xAI 的 Grok Imagine Video 1.5 Lite 已在 fal 上线,这是 Grok Imagine 视频家族中的轻量级模型,支持文生视频和图生视频并带原生音频。该模型可生成 1 至 15 秒、480p/720p/1080p 分辨率的视频,覆盖从 16:9 到 9:16 的 7 种宽高比。
Grok Imagine Video 1.5 Lite 已在 fal 上线,是 Grok Imagine 视频家族中的轻量级模型。它支持文生视频与图生视频,可生成 1 至 15 秒、带原生音频的视频,输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种宽高比。
fal 在 YouTube 上线了 GenMedia Conference 2026 的官方回顾 Vlog,供错过现场的人补看。该 Vlog 由 fal 官方发布,内容涵盖本届大会的 Creative 环节与公司氛围片段。
OpenAI Developers 与 Casey 对谈创意未来,展示如何从一个想法直接做出可在 ModRetro 掌机上实际游玩的游戏。讨论焦点在于想法到可玩成品之间的落差正在迅速缩小,且该游戏需运行在 160×144 屏幕上,当生成能力趋于无限时,约束反而成为稀缺的创意输入。
OpenAI Developers 的征集活动将于 10 月 3 日下午 2:30 PT 截止提交,距今仅剩 2 天。评论区有人询问评审标准是技术实现还是产品市场契合度,也有人提到本地构建时间紧张。
本周,我作为少数获得行程支持的社区大使之一,首次参加了在旧金山举办的 OpenAI DevDay,主办方承担了机票、酒店、交通和 DevDay 门票。
OpenAI Developers 转发了一段 dots 在 Apple Watch 上的演示,并称其"WiFi 更好了"。用户可通过 TestFlight 更新至最新版本,目前仍以私信邀请方式发放 beta 测试名额。
OpenAI 为 DevDay 上线 side quest 活动,含 10 项 builder 挑战,完成任意 5 项即可各获 1 张抽奖券,奖品为 5 台 Codex Micro,全球均可参与。报名窗口还剩 48 小时,提交将于 10 月 3 日下午 2:30 PT 截止。
OpenAI Developers 提醒,相关提交将在 2 天后、即 10 月 3 日下午 2:30 PT 截止。
开发者 Elizabeth Siegle 用 OpenAI 智能体做出首款 ModRetro Chromatic 掌机游戏,玩家在游戏中经营马萨诸塞州西部一家关注新冠防护的女同性恋酒吧,并撑过小丑学校 Zoom 混乱的周六班次来赚取积分和社区支持。该项目上周末以 webapp 起步,拿到 Chromatic 硬件后转为 Gameboy 应用,全部智能体会话记录发布在 EntireHQ 上。
有开发者因期待 OpenAI DevDay 发布可随身与 Dots 对话的设备未果,便用 M5Stack StopWatch 自行搭建。目前屏幕常亮且连接保持时续航仅两三个小时,作者计划在功能完成后优化续航,并正尝试让其在 Stack-chan 上显示。
一名用户在自动驾驶汽车行驶途中,用 Codex 安装了一款由 AI 在他睡觉时自行制作的游戏。该用户称这一体验"太疯狂了",并 @OpenAI 与 @OpenAIDevs 分享。评论区有人追问游戏内容,也有人调侃"Codex 交付了游戏,汽车交付了通勤"。
GPT-6.1 Astra 在生成简单 Gaussian Splats 上表现突出。用户让它结合 Blender MCP 与 Lichtfeld Studio,复刻了一个新的 ChatGPT agent 圆点,成品在基于 playcanvas 的 SuperSplat 编辑器中网页预览效果清晰锐利。
OpenAI Developers(@OpenAIDevs)转发了一条内容,配文称"幸好我妻子比我更怀旧",并附有一段视频。原文未提供更多关于视频内容或相关产品的信息。
开发者正在为 OpenAI Codex Physical Builds 项目构建模块化漫游车 MOSS,从第一天起就支持不同硬件组合。用户可用 Raspberry Pi 5(带或不带 Hailo)或 Jetson,搭配 RealSense 或 Gemini 深度相机,不同组合驱动同一台漫游车。
OpenAI Developers 9 月更新中,GPT-6.1 与常驻 AI 智能体 dots 成为 DevDay 之后可上手尝试的新内容。dots 是始终在线的 AI 智能体,拥有自己的云计算机,能够编写代码、修复 bug 等。
OpenAI Developers 介绍 dot 能学习用户工作方式、跨应用保留上下文、协调 Codex 任务并提示需要关注的事项。开发者 dominik kundel 表示 dot 与 Codex 配合良好,dot 已成为他使用 Codex 的首选方式,可减少心智负担,其主动性很实用。
Awesome Sites 现已开启投票,可前往为喜欢的作品投票。OpenAI Developers 转发该消息并推荐了 Jelly Hockey 这一作品。
OpenAI Agents API 团队公布本周更新,新增 Computer use 能力,可通过 1 次 API 调用启动浏览器加智能体。同时上线 Bedrock Managed Agents(Agents API 接入 AWS)、可选轻量或高性能的 oai 托管环境规格、Dashboard 中配置 subagents、环境可在多个会话间复用。
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。
OpenRouter 上线 IP allowlist 功能,管理员可将 API 访问限制在已批准的 IP 地址范围内,来自其他地址的请求会被拦截。该功能面向需要收紧 API 调用来源管控的管理员。
OpenRouter 上线 Security Center,可跨工作区查看全部 API 密钥并按风险标记,支持批量禁用、归档或限额最多 500 个密钥。该功能含 Overview、key safety 和 IP allowlist 三个标签页,风险分组包括无消费限额、无过期时间、90 天以上未使用等,IP allowlist 可限制仅获批 IP 地址访问 API。