#编码
#编码
_rajanagarwal@_rajanagarwalAI 评分 thsottiaux@thsottiauxAI 评分 Yuchenj_UW@Yuchenj_UWAI 评分 AmirMushich@AmirMushichAI 评分 omarsar0@omarsar0AI 评分
Hesamation@HesamationAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 ClaudeDevs@ClaudeDevsAI 评分 ClaudeDevs@ClaudeDevsAI 评分 ClaudeDevs@ClaudeDevsAI 评分
The DecoderAI 评分AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对
研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Qodo 3.0 发布 PR Triage:为编码智能体跨仓库 PR 提供整体审查
Qodo 推出 Qodo 3.0,新增 PR Triage 功能,将编码智能体跨不同仓库产生的相关 PR 归组为一个工作包,并按代码库影响、SLA 和未决问题打分。跨仓库地图展示工作包涉及的每个仓库,每项评分附有自身推理依据,Qodo 为整个工作包生成一份审查简报,让审查者一起审查 PR,人类仍负责最终批准代码。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Claude Code、DeepSeek Harness 与 Pi Durable:可扩展 harness 成编码智能体新战场
Claude Code 的 Mods、DeepSeek Harness 和 Pi Durable 都在提升 harness 的可扩展性,让开发者能定制 UI 行为、添加插件甚至支持多人协作。作者认为通用 harness 已难以满足 agentic 应用、无头体验和软件工厂等场景,建议从零自建,而 Pi Durable 与 DeepSeek Harness 正试图降低这一门槛。
claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 trq212@trq212AI 评分 所有软件都在变得可塑,因此在 Claude Code 中将其作为一等公民支持对我们很重要,我希望越来越多的软件能像这样变得可扩展! 以下是我对 mods 最期待的一些方面:
trq212@trq212AI 评分 Claude 可以为你制作 mods! 只需给出提示词,阅读 @addyosmani 的博客文章了解更多:claude.dev/blog/getting-star…
trq212@trq212AI 评分 我通常为开发者写作,但我的下一篇文章将面向试图应对 AI 编程智能体变革的公司领导者。 你们希望领导层了解智能体的哪些方面?或者如果你在经营一家公司——你遇到了哪些问题?
X:Rohan Paul (@rohanpaul_ai)AI 评分 研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
X:Testing Catalog (@testingcatalog)AI 评分 每日 AI 简报:Grok 4.7 全模式上线,Claude Code 推出 Mods,微软发布三款 MAI 音频模型
Grok 4.7 正在 Grok 网页版和移动端推送,成为 Fast、Expert、Build、Heavy 全部模式的基座模型,并上线 Google 的 Gemini Enterprise Agent Platform;Grok Bot 逐步转向主动建议,Grok Build 新增 /dashboard 智能体面板。
testingcatalog@testingcatalogAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 arena@arenaAI 评分 Arena 发布本周榜单汇总,四个模型发布重塑了 Text、Code 和 Agent Arena 的 Pareto 前沿。
lizziepika@lizziepikaAI 评分 NicholasRuncie@NicholasRuncieAI 评分 metrox_eth@metrox_ethAI 评分 OpenAIDevs@OpenAIDevsAI 评分 OpenAIDevs@OpenAIDevsAI 评分 thsottiaux@thsottiauxAI 评分 longhaiqwe123@longhaiqwe123AI 评分 Replit@ReplitAI 评分 Hailuo_AI@Hailuo_AIAI 评分 lydiahallie@lydiahallieAI 评分 有几位问到 mods 是什么,这里快速讲解一下!它们其实就是带几个特殊功能的插件,让你的代码在 Claude Code 内部运行,类似中间件。 (别担心,你直接让 Claude 帮你写就行 😛)
trq212@trq212AI 评分 "You should know" 是紧跟 Claude 各种可能性的好方法,也是 mod 能实现的绝佳示例。 你真的可以让 Claude Code 变成你自己的。
ClaudeDevs@ClaudeDevsAI 评分 mattyp@mattypAI 评分 cursor_ai@cursor_aiAI 评分 当 Rollouts 捕获到回归时,它会找到有问题的 PR 并开启 issue。一键即可启动云端 agent 进行修复。 Rollouts 使用额度包含至 10 月 3 日。