作者引述一篇论文指出,在整仓库迁移任务中,同一 GPT-5.6 Sol 模型与相同 effort 设置下,把 Codex 换成 HERMES harness 后成功率从 6.5% 升至 31.0%。
#编码
#编码
omarsar0@omarsar0AI 评分 omarsar0@omarsar0AI 评分
rohanpaul_ai@rohanpaul_aiAI 评分 dair_ai@dair_aiAI 评分 DAIR.AI 推荐一篇论文,研究模型不变时 agent harness 会带来什么变化。作者用同一模型在 SWE-bench Verified 上运行 Claude Code。
dair_ai@dair_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
rohanpaul_ai@rohanpaul_aiAI 评分
GitHub Blog · AI & MLAI 评分GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放基准,研究预览版现已上线。
omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_ai精选AI 评分 推荐理由:编辑精选:介绍通过共享工具协调的无中心编码智能体团队,具有明确的工程实现与评测场景。论文转述尚未提供大团队成本,不能仅凭得分判断性价比。
dair_ai@dair_aiAI 评分 DAIR.AI 推荐 Meta 关于可靠自动科研智能体的论文 RankEvolve:它用编译后的协议约束每个研究阶段与关卡,让 Claude Code 和 Codex 作为独立节点互相评审并修复改动。
omarsar0@omarsar0AI 评分
The DecoderAI 评分AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对
研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。
X:Rohan Paul (@rohanpaul_ai)AI 评分 研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
_akhaliq@_akhaliqAI 评分 LEGO-Anything 用于3D场景重建的编码智能体 论文:huggingface.co/papers/2609.3…
andrezfu@andrezfuAI 评分 智能体写应用代码,但出问题时你凌晨 2 点还是得被叫醒。 我们想知道 AI 能否也处理这部分工作。 推出 Incident Arena:一个让编码智能体值班的基准! 查看下方论文与完整数据集发布!
Hugging Face Blog精选AI 评分
Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。
Import AIAI 评分Import AI 466:机器人领域的苦涩教训、AI 完成周级编程任务与 OpenAI 意外出现的 AI 黑客
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成长周期编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一个 METR 与 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100% 阈值。
OpenAI NewsAI 评分 OpenAI 分析指出 SWE-Bench Pro 编码评测存在可靠性问题
OpenAI 发布新分析,指出流行编码基准 SWE-Bench Pro 存在可靠性与准确性方面的问题。该分析揭示了这一用于评估 AI 模型的基准在评测中可能产生误导性结果。
Hugging Face BlogAI 评分
ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
OpenAI NewsAI 评分 OpenAI 发布 SWE-Lancer 基准测试
OpenAI 推出 SWE-Lancer 基准测试,用于检验前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元。该基准围绕真实外包项目设计,衡量模型在实际软件工程工作中的表现。
OpenAI News精选AI 评分 OpenAI 发布人工校验的 SWE-bench Verified
OpenAI 发布 SWE-bench 的人工校验子集 SWE-bench Verified,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于比较模型解决真实软件问题的能力。
Hugging Face BlogAI 评分
BigCodeBench:下一代 HumanEval 代码生成基准
Hugging Face 发布 BigCodeBench,一个面向大语言模型代码生成的新基准,包含 1,140 个函数级任务,需调用来自 139 个库的多个函数,每项任务平均含 5.6 个测试用例、分支覆盖率平均 99%。
Hugging Face BlogAI 评分
Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架
Meta 推出 CyberSecEval 2,从代码解释器滥用、攻击性网络安全能力和提示注入攻击三方面评估 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率已从 52% 降至 28%。测试显示提示注入仍是未解难题,LLM 目前也难以可靠完成端到端漏洞利用挑战。
Hugging Face BlogAI 评分
Hugging Face 推出 LiveCodeBench 排行榜:面向代码 LLM 的无污染整体评估
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
Hugging Face BlogAI 评分
Hugging Face 发布 WebSight 数据集,用截图生成 HTML 代码
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。