OpenAI Python SDK 3.24.0 新增 Voices API,ChatGPT 上线虚拟试穿
OpenAI 的 Python SDK 3.24.0 静默新增 Voices API,可用文本提示词或音频样本创建自定义语音;ChatGPT 面向全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
OpenAI 的 Python SDK 3.24.0 静默新增 Voices API,可用文本提示词或音频样本创建自定义语音;ChatGPT 面向全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间同行贡献了 AI 公司投资额的 55.2%,AI 投资者自身交易额的 28.7% 流向 AI 标的。
Grok 4.7 正在 Grok 网页版和移动端推送,成为 Fast、Expert、Build、Heavy 全部模式的基座模型,并上线 Google 的 Gemini Enterprise Agent Platform;Grok Bot 逐步转向主动建议,Grok Build 新增 /dashboard 智能体面板。
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。
微软宣布将“仿生学”设计推广到美国与德国 20 多个数据中心站点,通过增加花园、本地树木和生态修复,把设施“融入自然景观”以缓解噪音、绿地和污染争议。微软称已在 34 个以上国家运营 300 多座数据中心,2022 年起在荷兰试点该项目,并计划对所有美国新项目采用同样做法。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Google 推出 @google/stitch CLI,可在终端连接本地编程智能体、生成界面与设计系统,并把本地 dev server 快照发送到 Stitch。此前 Stitch 已有 MCP 和 SDK,但一直没有 CLI,此次补齐了这一入口。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码或手动设计。
GitHub Copilot 应用中的 canvas 是一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。
GitHub Copilot 应用重建了 pull request 视图,以应对包含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 diff。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则延迟测量、按文件与行锚定,避免滚动跳变。
微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。
推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。
SpaceXAI 的 Grok 模型正在 Copilot 的 Word、Excel 和 PowerPoint 中推出,首批面向 Microsoft Frontier 计划客户定向发布。
GitHub 日本和韩国营销负责人用 GitHub Copilot 把活动运营自动化:以 GitHub Issue 为工作单元,Issue forms 收集活动字段、Labels 触发 GitHub Actions 工作流,活动从单个 Issue 自动搭建、每日自动筛选报名者并在结束后自动清理。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正被集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软研究院推出持续追踪各版本计算性能的 living benchmark。
微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。