跳到正文

全部动态

今日 13 条
10月3日周六
  1. X:Artificial Analysis (@ArtificialAnlys)78

    Artificial Analysis 编码智能体指数:Claude Sonnet 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 登顶但成本差异显著

    Artificial Analysis 的 Coding Agent Index 显示,本周发布的 Claude Sonnet 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 均接近榜单前列,但性能与成本平衡各不相同。

    推荐理由:榜单把三款新模型的编码智能体得分与单任务成本并列,读者可据此比较性能与开销的取舍。

  2. X:Artificial Analysis (@ArtificialAnlys)30

    Artificial Analysis 推出 AI 模型对比工具,可并排比较基准分数与成本

    Artificial Analysis 上线模型对比工具,支持任选模型并排比较 Intelligence Index 与单项 benchmark 分数。该工具还提供 Capability Index 分数,覆盖金融会计、战略运营、法律、医疗、工程和经济学领域,并可按输入、输出和缓存 token 拆分成本,同时展示输出速度与延迟。

  3. X:swyx (@swyx)40

    MIT 张艾伦谈递归语言模型:Claude Code、Codex 与 Pi 本质相同,以及 OpenAI 万级智能体实验

    MIT 研究者 @a1zhang 在 Latent Space 播客中提出递归语言模型(RLM),认为 Claude Code、Codex 和 Pi 本质上是同一类东西,通过代码、上下文卸载和递归子智能体实现跨任务泛化。他援引 OpenAI 一项 10,000 个智能体、130B 输出 token 的实验,讨论语言模型的未来,并指出有时一个专家就能替代万亿 token 的暴力搜索。

  4. X:swyx (@swyx)66

    Anthropic 介绍 Claude Mods:可读取对话上下文、派生 subagent 并修改 UI

    Anthropic 的 Thariq 介绍了 Claude Mods 解锁的能力,包括对话上下文、subagent、结构化输出和对 UI 的控制。他表示 Mods 的作用域内包含对话有多少轮、已用多少 token 等信息;因为都在进程内运行,可以派生 subagent、解析其结果并用结构化输出返回;还可以修改 UI,这是 hooks 做不到的。

  5. X:swyx (@swyx)12

    swyx 宣布第二届 AI Security Summit 将于 2026 年 10 月 15 日在旧金山举办

    swyx 以创始合作伙伴身份回归第二届 AI Security Summit,活动将于 2026 年 10 月 15 日在旧金山举行,2025 年的所有合作伙伴均已回归。他表示自一年前启动以来,恶意智能体数量激增、数据泄露和 AI 驱动的攻击增多,安全问题已不再是理论问题,必须成为 AI 讨论的核心。

  6. X:swyx (@swyx)22

    a1zhang:学术界是下大研究赌注的地方,Latent Space 播客谈 kernel、harness 设计与多智能体系统

    MIT 博士生 a1zhang 认为学术界适合下大研究赌注:PhD 研究者虽没有无限算力,但能自由探索主流之外的想法、权衡不同取舍,从而催生新范式。昨日 Latent Space 播客与 swyx 的对谈还覆盖了 kernel、harness 设计、多智能体系统,以及从 GPU kernel、KernelBench 到 Recursive Language Models 的路径。

  7. X:Claude Devs (@ClaudeDevs)62

    Anthropic 为 Claude Code 推出 mods 定制功能

    Anthropic 的 Claude Devs 宣布 Claude Code 支持 mods,即用 TypeScript 函数改变 Claude Code 的工作方式,可改写提示词、拦截高风险命令、添加自定义 UI 或替换内置功能。官方称已用 mods 构建了 /diff 和 AGENTS.md 支持等功能,用户可自行编写或让 Claude Code 代写。

  8. X:DAIR.AI (@dair_ai)48

    微软 FOCUS:无需训练的智能体上下文压缩方法

    微软提出 FOCUS,一种在测试时压缩智能体上下文的方法,通过判断智能体下一步决策真正依赖哪些历史交互,保留这些单元并丢弃其余部分。该方法无需训练数据或微调,可作为独立层部署在闭源 API 模型之前。在工具调用、QA、网页和多轮对话基准上,FOCUS 将峰值上下文最多减少 48%,任务成功率最多提升 8.9 个百分点。

  9. X:Francois Chollet (@fchollet)45

    Francois Chollet:base LLM 与 LRM 的关键区别在于从转导范式转向归纳范式

    Francois Chollet 指出,base LLM(2024 及更早)与现代 LRM 的关键区别不是符号工具使用,而是从转导范式(直觉给出查询答案)转向归纳范式(直觉给出产生答案的程序/指令),LRM 经训练具备归纳能力并在测试时进行归纳,即预测自然语言程序/推理链。