跳到正文

#编码

今日 2 条
今天10月9日周五
10月8日周四
  1. GitHub Blog · AI & ML63

    GitHub 发布 ModernBERT 密钥分类器,推送拦截可在 2 毫秒内评估候选密钥

    GitHub 发布与 Microsoft Applied Sciences 合作微调的 ModernBERT 密钥分类器,能在 2 毫秒内评估一批候选密钥,使可拦截的密钥数量翻倍以上。

    推荐理由:原文用九个季度数据拆解了泄露密钥随代码量增长的成因,并给出新模型如何在推送环节拦截,读者可据此理解平台侧防护的思路转变。

10月7日周三
  1. Hugging Face Blog75

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    NVIDIA 官方博客称,基于 Nemotron 3 用 SFT、RL 与反馈式推理特化的系统在 IOI 2026 与 IMO 2026 均达金牌水平:Nemotron-3-Ultra-CC 得 535.4/600,超过 361.12 的金牌线与人类最高分 498.27;IMO 系统得 30/42,超过官方金牌线 29。

    推荐理由:原文给出从基座到数据再到推理循环的四步特化配方,读者可据此评估复现金牌级系统的成本与路径。

10月6日周二
  1. AWS Machine Learning Blog63

    GLM 5.3 上线 Amazon Bedrock:753B MoE 模型面向编码与长程智能体任务

    Z.ai(智谱 AI)的 GLM 5.3 现已上线 Amazon Bedrock,这是一款 753B 参数 MoE 模型,面向编码与长程智能体任务,可通过全托管 API 使用,支持跨区域推理、prompt caching 和服务层级。

    推荐理由:原文给出接入方式、缓存配置和完整实测流程,可直接照做部署与成本优化。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作,GitHub 给出三项需要强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次回答、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

9月30日周三
  1. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,每任务成本约为其五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。

    推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比。

9月29日周二
  1. OpenAI News80

    OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作

    OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。

    推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。

9月28日周一
9月26日周六
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 已死、Skills 杀死 MCP?

    GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。

9月17日周四
  1. GitHub Blog · AI & ML62

    GitHub 用 Copilot 将 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量落地,性能提升数个数量级。

    推荐理由:GitHub 工程师复盘用 Copilot 把运行时从 TypeScript 迁到 Rust 的全过程,含提示缓存、子智能体分工等可迁移的工程经验。

9月12日周六
9月11日周五
9月9日周三
  1. Mistral AI40

    Mistral 如何用 AI 智能体现代化改造复杂遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。团队先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人工介入的 coder、tester、reviewer 智能体工作流逐模块迁移。

9月8日周二
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML66

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,在运行时通过多模型编排完成任务,已面向所有 GitHub Copilot 套餐开放,可在 GitHub Copilot CLI 中通过 /experimental 启用。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。

9月3日周四
  1. OpenAI News84

    OpenAI 发布 GPT-6 Astra 新一代模型

    OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。

    推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。

  2. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。

8月31日周一
8月26日周三
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。

8月24日周一
8月20日周四
8月18日周二
8月14日周五
7月29日周三
7月22日周三
7月21日周二
7月16日周四
7月8日周三
7月7日周二
7月1日周三