跳到正文

#Agent

今日 96 条
今天10月3日周六
  1. X:蚂蚁百灵 (@AntLingAGI)71

    蚂蚁百灵发布 Ling-3.1-flash,约 560B 参数、支持 1M token 上下文并上线 OpenRouter

    蚂蚁百灵发布 Ling-3.1-flash,总参数约 560B、每 token 激活约 25B,支持最高 1M token 上下文,并计划近期开源。该模型已在 OpenRouter 免费上线,官方称其在 GDPVal-AA v2.1 上取得 1,673 Elo、FrontierSWE 75.16、HealthBench Professional 65.35。

    推荐理由:官方给出 Ling-3.1-flash 的参数量、上下文与多项基准成绩,可据此判断其编码与智能体能力定位。

10月2日周五
  1. MIT Technology Review · AI12

    以自主 AI 重新定义企业智能

    MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。

  2. GitHub Blog · AI & ML22

    AI 正在改变开发者工作,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

  3. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,10 月 23 日开售 4999 美元起

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 新配置的价格、可跑模型规模与双机集群方式,便于判断本地跑智能体的硬件门槛。

  4. The Verge · AI30

    ChatGPT 模型幻觉正让顾客变得更难缠

    餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。

  5. Hugging Face Blog38

    ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。

  6. X:Thariq (@trq212)22

    开发者用 Claude 做游戏动画编辑器,迭代跳跃动画

    一位开发者用 Claude 辅助学习动画并生成参考,让 Claude 做出一个可迭代跳跃动画的动画编辑器,并晒出对比视频。他表示效果令人满意,但自知仍有不少问题,受限于自身技能水平,需要提升判断力。这是他的个人游戏原型副业项目,他主张不要用 AI 外包游戏创作,而是让 AI 配合实现自己的构想。

  7. X:Thariq (@trq212)22

    开发者用 Claude 打造游戏动画编辑器,迭代优化跳跃动画

    一位开发者借助 Claude 学习动画制作并查找参考资料,让 Claude 构建了一个动画编辑器,用于反复迭代游戏原型中的跳跃动画。他发布了前后对比视频,并表示对结果很满意,但坦言自己已到技能上限,仍需提升判断力。他强调这是个人副业项目,主张用 AI 辅助实现创意而非外包。

  8. X:洪明 (@hongming731)22

    BestBlogs 早报 · 10-02:Claude 科研协作、DHH 手写代码、600 美元 PR、LangChain 模型路由、Olmo-core 3、Cohere Embed 5

    LangChain 在 Open SWE 智能体 Harness 内构建模型路由器,按任务分类选择最低成本合适模型,将编码线程中位数成本降低 64% 且质量变化可忽略。Olmo-core 3 面向大规模 MoE 训练,在八块 B300 配置下吞吐量较前代提升 2.7 倍。Cohere 发布 Embed 5 嵌入模型系列,含 Pro 和 Fast 版本,面向搜索与智能体工作流。

  9. X:Boris Cherny (@bcherny)74

    Claude Code 推出 Mods,可用提示词定制行为与界面

    Claude Code 上线 Mods,用户可以通过提示词定制 Claude 的工作方式和外观,改变其行为、自定义 UI,或替换成自己的功能。Mods 用几行 TypeScript 编写,也可以让 Claude 代写,并以插件形式分发,在 CLI 或桌面应用中用 /plugin 安装,还能作为插件分享给他人使用。