跳到正文

#编码

今日 14 条
10月4日周日
10月3日周六
  1. The Decoder52

    AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对

    研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。

  2. X:Elvis Saravia (@omarsar0, DAIR.AI)42

    Qodo 3.0 发布 PR Triage:为编码智能体跨仓库 PR 提供整体审查

    Qodo 推出 Qodo 3.0,新增 PR Triage 功能,将编码智能体跨不同仓库产生的相关 PR 归组为一个工作包,并按代码库影响、SLA 和未决问题打分。跨仓库地图展示工作包涉及的每个仓库,每项评分附有自身推理依据,Qodo 为整个工作包生成一份审查简报,让审查者一起审查 PR,人类仍负责最终批准代码。

  3. X:Elvis Saravia (@omarsar0, DAIR.AI)34

    Claude Code、DeepSeek Harness 与 Pi Durable:可扩展 harness 成编码智能体新战场

    Claude Code 的 Mods、DeepSeek Harness 和 Pi Durable 都在提升 harness 的可扩展性,让开发者能定制 UI 行为、添加插件甚至支持多人协作。作者认为通用 harness 已难以满足 agentic 应用、无头体验和软件工厂等场景,建议从零自建,而 Pi Durable 与 DeepSeek Harness 正试图降低这一门槛。

  4. X:Rohan Paul (@rohanpaul_ai)44

    研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布

    来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。

10月2日周五