跳到正文

#Agent

今日 20 条
9月24日周四
  1. X:Greg Brockman (@gdb)78

    ChatGPT Voice 升级:可调用邮件、日历、Slack 等工具并接入 Work

    ChatGPT Voice 迎来大幅升级,现在可以调用邮件、日历、Slack 等插件,并支持由 GPT-6 Astra、Sol 和 Luna 驱动。该功能已在 ChatGPT Work 的网页端和移动端上线,用户可通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务,今日起随最新版应用全球推送。

    推荐理由:原文列出 ChatGPT Voice 新增的工具调用与模型支持,读者可据此判断语音入口能承接哪些实际任务。

  2. X:ChatGPT (@ChatGPT)85

    ChatGPT Voice 支持插件、GPT-6 Astra/Sol/Luna 并接入 ChatGPT Work

    ChatGPT Voice 更新,现可使用邮件、日历和 Slack 等插件,并由 GPT-6 Astra、Sol、Luna 提供支持。该功能同时接入网页端和移动端的 ChatGPT Work,用户可通过语音创建文档、演示文稿、网站和表格,或在浏览器中处理复杂任务。官方称该版本当天起在全球范围内推送。

    推荐理由:ChatGPT Voice 接入插件与 GPT-6 系列模型,并进入 ChatGPT Work,读者可据此判断语音入口能承接哪些实际任务。

  3. X:Eric Zakariasson (@ericzakariasson)40

    Cursor 通过优化读取将 token 成本降低 7%

    Cursor 宣布通过更紧凑的提示词、选择性工具加载、更好的缓存和压缩文件读取,将 token 成本降低 7%,且智能体质量没有下降。Eric Zakariasson 指出,智能体在工作前后会大量读取以收集上下文,因此针对读取做优化能带来显著差异,建议构建智能体的人参考这一发现。

9月23日周三
  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并降价 40-50%

    Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:汇总了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格、基准与第三方评测数据,便于横向比较两家新模型的定位差异。

  2. Simon Willison10

    Simon Willison 与 Jesse Vincent 将于 10 月 14 日在旧金山举办 Agentic Engineering 交流活动

    Simon Willison 与 Jesse Vincent 将于 10 月 14 日周三晚在旧金山举办一场面向 coding agent 构建者的 Birds of a Feather 交流活动。活动采用非正式 show-and-tell 形式,鼓励分享尚未公开的尝试、奇怪实验和没有明确市场前景的未完成项目,无需正式演讲,也不是产品推介。

  3. X:Eric Zakariasson (@ericzakariasson)22

    Eric Zakariasson 回顾 Grok Bot 客服系统:从 1.5 年前的粗糙版本到自主处理工单

    Eric Zakariasson 回忆约 1.5 年前为应对巨大流量而搭建的 Grok Bot 最初粗糙版本,称当时学到的经验至今仍适用:先爬、再走、后跑,找到持续改进的飞轮并保持运转。他引用 Grok Bot 官方账号称,团队围绕 Grok Bot 重建了 SpaceXAI 与 Cursor 合并后的客服运营,使其自主回复客户、解决工单并管理队列,从而在不增加人手的情况下扩展业务。

9月22日周二
  1. TencentHunyuan47

    AI 说网站做完了,结果首页报错、按钮重叠,还加了个你从没要求过的登录流程。🙃 推出 WebCraftBench:智能体实际使用线上应用,覆盖引导的探索找出从未被访问到的部分,然后我们对美观度、可用性以及原始需求是否满足进行评分。 在 197 组人工验证的配对上,与人类偏好的一致率为 85.3%。 论文:arxiv.org/abs/2609.15387

  2. X:面壁智能 OpenBMB (@OpenBMB)22

    面壁智能 MiniCPM5-2B 多智能体工作流实测:32 张发票 67.8 秒核验完成

    面壁智能 MiniCPM5-2B 被用于一个多智能体发票核验工作流,由 GPT-6 Astra 协调,MiniCPM5-2B 作为 worker 通过工具调用处理匹配、短付、重复引用和价格争议。测试使用 32 张合成发票,共执行 232 次工具调用,全部核验在 67.8 秒内完成,视频为实时录制,该演示不涉及真实资金流转。

  3. Latent Space80

    小米发布 MiMo-V2.6-Pro 与 Flash 开源全模态模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,Artificial Analysis 称其以 46 分登顶开源权重模型智能指数,输入输出价格分别为 $0.435/M 和 $0.87/M tokens,采用 MIT 许可。

    推荐理由:小米首次进入前沿开源模型序列,文中给出参数规模、训练成本与开源范围,可据此判断开源权重竞争的新格局。