全部AI 动态
全部动态
ChatGPT@ChatGPTAI 评分 X:Sundar Pichai (@sundarpichai)精选AI 评分 Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时音频模型
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新的 SOTA 实时音频模型,官方称其兼具前沿价格与性能。其中 3.8 Live 支持 97 种语言并可无缝切换,还支持异步工具调用等能力。
推荐理由:Google 发布 Gemini 3.8 Live 系列实时音频模型,读者可了解其语言覆盖与异步工具调用等能力变化。
GoogleAI@GoogleAI精选AI 评分 Google 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
推荐理由:原文区分了两个版本的定位差异,读者可据此判断日常对话与复杂任务该选哪一个。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与成本取舍。
GoogleDeepMind@GoogleDeepMind精选AI 评分
X:Jeff Dean (@JeffDean)AI 评分 RewardAI 发布机器人基础模型 OM-1,零样本泛化到各类机器人
RewardAI 发布首个机器人基础模型 OM-1,可零样本泛化到桌面机械臂、工业机械臂和人形机器人。该模型直接从人类操作数据学习,不使用遥操作或机器人数据,官方称其灵巧度与效率接近人类水平,并支持多机器人协作。
sankakuten91256@sankakuten91256AI 评分
leerob@leerobAI 评分 X:面壁智能 OpenBMB (@OpenBMB)AI 评分 MiniCPM5-2B 体验:2B 稠密模型、128k 上下文,本地跑在 MacBook Pro M5 上
面壁智能的 MiniCPM5-2B 是一款 2B 稠密参数模型,具备 128k 上下文窗口,可在 MacBook Pro M5 上通过 llama.cpp 完全本地运行。该模型在同等规模模型中表现更优,被评价为"同尺寸中的猛兽"。
X:面壁智能 OpenBMB (@OpenBMB)AI 评分 MiniCPM5-2B 手机端智能体实测:八个场景中哪些能跑通
作者对 OpenBMB 的 2B 开源模型 MiniCPM5-2B 做了手机端 iMessage 智能体实测,用六个工具、八个真实场景各跑三次。官方称该模型在 Artificial Analysis 4B 以下智能指数排名第一,智能体指数为 20,高于下一个小模型的 9。
UnitreeRobotics@UnitreeRoboticsAI 评分 deepseek_ai@deepseek_aiAI 评分 DesignArena@DesignArenaAI 评分
OpenAI News精选AI 评分 OpenAI 发布 GPT-6 Astra,面向企业场景的最强模型
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、computer use 以及更强的写作与设计判断力。
推荐理由:官方给出 GPT-6 Astra 的定位与三项能力方向,可据此了解 OpenAI 面向企业场景的模型迭代重点。
jcjohnss@jcjohnssAI 评分 我们的新 Atlas 模型经过一番高强度的推理优化后,现在可以实时运行了!当世界生成与导航是交互式的,体验要生动得多。 推理在 B200 和 MI355X 上运行,性能相近。两款设备都是出色的主力!
kim__minseon@kim__minseonAI 评分 X:Noam Brown (@polynoamial)AI 评分 Dean W. Ball:解决 Navier-Stokes 问题用的是比 GPT-6 Astra 更强的内部模型
Dean W. Ball 转述称,为解决 Navier-Stokes 问题,团队使用了一个能力显著强于 GPT-6 Astra 的内部模型。该说法未披露模型名称、参数规模或可用性信息。
weijie444@weijie444AI 评分 去年7月,当大语言模型在IMO上夺得金牌时,我觉得AI或许有一天能解决数学中最难的一些问题。现在,一个OpenAI内部模型(仍在改进!)已经解决了一个千禧年难题。这一天来得如此之快,感觉很不真实!
OpenAI@OpenAIAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时卫星观测数据,逐小时生成预报。
推荐理由:WeatherNext 3 把实时卫星数据与逐小时更新纳入全球天气预报,读者可据此了解 AI 气象模型在分辨率与降水精度上的进展。
Hugging Face BlogAI 评分
Hugging Face 推出 NeoMME:高效多模态多语言编码器
Hugging Face 发布 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 直接处理文本 token 与原始图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
OpenAI News精选AI 评分 OpenAI 发布 GPT-6 Astra 新一代模型
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。
推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。
OpenAI News精选AI 评分 OpenAI 发布 GPT-6 Astra 安全概览
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
X:Sundar Pichai (@sundarpichai)AI 评分 Google 推出 3.8 Flash Cyber,通过 Fairwind 计划向政府与安全伙伴开放
Google 在真实 Chrome 安全漏洞评测中,3.8 Flash Cyber 生成的正确漏洞补丁数量比更大的模型多 2.6 倍。由于能力较强,Google 通过 Fairwind 计划向政府机构和网络安全合作伙伴提供该模型的访问权限,该计划为受限访问项目。
X:Sundar Pichai (@sundarpichai)AI 评分 Google 发布 Gemini 3.8 Flash Cyber 网络安全模型
Google 推出 Gemini 3.8 Flash Cyber,称其为自家能力最强的网络安全模型,在漏洞发现与大规模修复上达到前沿水平,同时保持 Flash 级速度与定价。该模型在 CyberGym 基准上取得 86.2%,在 CWE-Bench 修复任务上取得 47.2%,并在内部基准的 20 种编程语言漏洞发现中成功率超过 70%。
X:Sundar Pichai (@sundarpichai)AI 评分 Google 发布 3.8 Flash 模型,6 周内第三次 Flash 更新
Google 发布 3.8 Flash 模型,这是 6 周内的第三次 Flash 发布。相比 3.7 Flash,新版本在软件工程、智能体任务和多步推理上有明显提升。在 DeepSWE v1.1 上,它以更低的成本端到端自主解决复杂工程问题,表现超过大多数更大的前沿模型。
X:Josh Woodward (@joshwoodward, Google Labs VP)AI 评分 Google Labs 的 3.8 Flash:高质量、低价格
Google Labs 副总裁 Josh Woodward 称 3.8 Flash 兼具高质量与低价格。原文未披露该模型的具体参数、benchmark 分数或定价细节。
OfficialLoganK@OfficialLoganKAI 评分 X:Josh Woodward (@joshwoodward, Google Labs VP)AI 评分 Gemini 3.8 Flash 开始在 Gemini App 推送
Google Labs 副总裁 Josh Woodward 表示,3.8 Flash 正在向 Gemini App 推送。
ammaar@ammaarAI 评分 OfficialLoganK@OfficialLoganKAI 评分 OfficialLoganK@OfficialLoganKAI 评分 Google 发布 Gemini 3.8 Flash,称其在智能体与编码能力上再次提升,是 6 周内第 3 个更新的 Flash 模型。作者表示该模型开发过程很有趣,期待用户反馈。
theworldlabs@theworldlabsAI 评分 所有这些都由一个统一架构驱动:一个从零预训练的多模态自回归扩散 Transformer。 这一基础融合了现代 LLM 和视频模型的优势,受益于这两个领域的架构、算法和系统进步。
theworldlabs@theworldlabsAI 评分 Atlas 是我们可扩展的基础模型,能够感知、生成、推理,并与虚拟和物理世界交互。 我们将在未来几周内开放早期访问。 点击此处了解详情并注册: worldlabs.ai/blog/atlas
SpaceXAI@SpaceXAIAI 评分
OpenAI News精选AI 评分 OpenAI 称 Astra 成为首个触及关键网络安全能力阈值的模型
OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,因此发布时配备了更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛设定。
Google ResearchAI 评分Google 发布 TimesFM-3:面向多变量预测的零样本基础模型
Google 推出 TimesFM-3 时间序列基础模型,330M 参数、在超 1 万亿时间点上预训练,原生支持多变量零样本预测,单次前向即可输出完整预测区间。它支持多目标、历史协变量与已知未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个公开基准上取得点预测与概率预测双项第一。