#具身智能
#具身智能
HuggingPapers@HuggingPapersAI 评分
omarsar0@omarsar0AI 评分 testingcatalog@testingcatalogAI 评分 testingcatalog@testingcatalogAI 评分
HuggingPapers@HuggingPapersAI 评分 NVIDIA 发布 Long-WAM,一个通过扩展视觉上下文实现机器人实时控制的世界动作模型。原文指出,能访问历史不等于会用历史,当视频基础模型采用自回归预训练时,更长的历史带来的收益会大得多。
The DecoderAI 评分Reka AI 发布全模态模型 Rho-1,单模型统一处理文本图像视频与机器人控制
Reka AI 发布了 Rho-1 的研究预览,这是一个 190 亿参数的全模态模型,在单一神经网络中处理并生成文本、图像、视频和机器人控制动作,所有模态以 token 形式运行在同一共享上下文窗口中,无需工具调用或外部模型。
theworldlabs@theworldlabsAI 评分 Atlas 是我们可扩展的基础模型,能够感知、生成、推理,并与虚拟和物理世界交互。 我们将在未来几周内开放早期访问。 点击此处了解详情并注册: worldlabs.ai/blog/atlas
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型
Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,支持视频理解、任务编排与多机器人协作,并可将动作执行交给底层 VLA 模型。
推荐理由:官方给出 Gemini Robotics ER 2 在进度分类、时刻定位与多机器人协作上的量化结果,可对照上一代判断具身推理模型的进展。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:三款模型分别覆盖全身控制、具身推理与端侧部署,读者可据此判断机器人智能层的分工方式。
Hugging Face BlogAI 评分
NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式仿真
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 流式推理库部署。
Mistral AI精选AI 评分
Mistral 发布 Robostral Navigate 具身导航模型
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可对比多传感器方案的成本与效果。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理、多视角理解与任务成功检测。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并说明仪表读数等新能力的实现路径。