跳到正文

#编码

今日 2 条
今天10月9日周五
10月8日周四
10月7日周三
10月6日周二
10月5日周一
  1. rohanpaul_ai57

    微软一篇新论文提出,编码智能体无需中心管理者:在 ProgramBench 的 200 项任务中,让智能体自行认领任务的无管理者团队规模从 1 扩展到 128 个智能体时,平均得分在每一步都有提升,即使在最难的 5 项任务上也是如此。

    推荐理由:编辑精选:介绍通过共享工具协调的无中心编码智能体团队,具有明确的工程实现与评测场景。论文转述尚未提供大团队成本,不能仅凭得分判断性价比。

10月4日周日
10月3日周六
  1. The Decoder52

    AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对

    研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。

  2. X:Rohan Paul (@rohanpaul_ai)44

    研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布

    来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。

10月1日周四
9月22日周二
  1. TencentHunyuan47

    AI 说网站做完了,结果首页报错、按钮重叠,还加了个你从没要求过的登录流程。🙃 推出 WebCraftBench:智能体实际使用线上应用,覆盖引导的探索找出从未被访问到的部分,然后我们对美观度、可用性以及原始需求是否满足进行评分。 在 197 组人工验证的配对上,与人类偏好的一致率为 85.3%。 论文:arxiv.org/abs/2609.15387

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。

7月27日周一
7月8日周三
7月1日周三
2月18日周二
8月13日周二
6月18日周二
5月24日周五
  1. Hugging Face Blog43

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。

4月16日周二
3月15日周五
  1. Hugging Face Blog41

    Hugging Face 发布 WebSight 数据集,用截图生成 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。