#编码
#编码
cursor_ai@cursor_aiAI 评分 cursor_ai@cursor_aiAI 评分 Meituan_LongCat@Meituan_LongCatAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:官方给出 3.8 Flash 与 Cyber 两个变体的基准成绩、定价和开放入口,可据此判断长程编码与漏洞修复的可用性。
OfficialLoganK@OfficialLoganKAI 评分 Google 发布 Gemini 3.8 Flash,称其在智能体与编码能力上再次提升,是 6 周内第 3 个更新的 Flash 模型。作者表示该模型开发过程很有趣,期待用户反馈。
Meituan_LongCat@Meituan_LongCatAI 评分
OpenAI NewsAI 评分 Polimill 用 OpenAI GPT 模型和 Codex 构建日本下一代公共 AI 基础设施
Polimill 正基于 OpenAI 的 GPT 模型和 Codex 构建日本下一代公共 AI 基础设施,帮助地方政府检索和使用行政知识,同时加快开发进度。
UnslothAI@UnslothAIAI 评分 OpenSquilla@OpenSquillaAI 评分
tickerplus@tickerplusAI 评分 OpenAI NewsAI 评分 loveholidays 如何用 Codex 让全员成为开发者
loveholidays 借助 OpenAI Codex 让公司各团队都能参与软件开发,把想法更快变成产品。该案例展示了 Codex 如何降低开发门槛,使非工程岗位也能动手构建。
leerob@leerobAI 评分 注意,这适用于 Cursor 中所有第一方模型,包括 Composer 2.5 和未来的 Grok 模型。 我们也在努力让你的 Grok Bot 用量持续更久!更多消息即将公布。
Hugging Face Blog精选AI 评分
Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本
Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。
Meituan_LongCat@Meituan_LongCatAI 评分 OpenAI NewsAI 评分 GPT-5.6 在 Kiro 上线,提升开发者性价比
GPT-5.6 现已在 Kiro 中可用,帮助开发者完成软件的规划、构建、审查与测试,并带来更好的性价比。
leerob@leerobAI 评分 我原以为 Cursor 的增长已经很疯狂了,但 Grok @Bot 让我大为震撼。这感觉很特别。 我们会训练 Grok 4.7,确保它在 Bot harness 中表现出色!
OpenAI NewsAI 评分 Stampli 用 ChatGPT Work 将发布工时缩短 68%
Stampli 借助 Codex 和 ChatGPT Work,把原本需要数周的发布物料制作压缩到几天,发布工时减少 68%。在截止日期固定、设计资源被占用的情况下,该公司用这套组合完成了上线生产。
OpenAI NewsAI 评分 Asana 用 Codex 两周完成多年代码迁移
Asana 借助 OpenAI Codex 在两周内替换了陈旧的测试系统,模型与基础设施成本约 1.2 万美元。这项原本预计耗时数年的代码迁移由此大幅提速。
leerob@leerobAI 评分 leerob 宣布 Cursor 正式加入 SpaceX,并表示团队进展顺利,Grok 4.6 与 Grok Bot 的势头正在加速。他本人将致力于让 Grok 更有用、更有品味且更安全。
leerob@leerobAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和智能体最强的主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出 3.7 Flash 在编码、文档与业务工作流上的基准对比和限时定价,可据此评估升级与成本。
ammaar@ammaarAI 评分 ammaar@ammaarAI 评分
Meituan_LongCat@Meituan_LongCatAI 评分 Meituan_LongCat@Meituan_LongCatAI 评分 🎮 小游戏 我们描述了一个游戏创意。LongCat-2.0 把它变成了可玩的东西。 piped.video/shorts/nDfadOkOJ…
OpenAI NewsAI 评分 OpenAI 报告:AI 编程智能体如何加速科学计算现代化
OpenAI 发布一份实地报告,展示科学家如何用 AI 编程智能体推进科学计算现代化,加快软件开发与发现,覆盖基因组学等领域。
Import AIAI 评分Import AI 466:机器人领域的苦涩教训、AI 完成周级编程任务与 OpenAI 意外出现的 AI 黑客
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统完成长周期编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一个 METR 与 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100% 阈值。
OpenAI NewsAI 评分 NTT DATA Group 用 Codex 将事件分析缩短至 30 分钟
NTT DATA Group 借助 ChatGPT Enterprise 和 Codex,帮助 9,000 名员工实现工作自动化,并将事件分析时间缩短至 30 分钟。该集团同时借此推进安全可控的 AI 规模化落地。
ammaar@ammaarAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款 Flash 新模型的定价、基准与开放入口,可据此判断智能体工作流的成本与延迟取舍。
OpenAI NewsAI 评分 OpenAI 创意团队如何用 Codex 打造协作工具
OpenAI 创意团队借助 Codex 构建定制创意工具,加速创意构思并更快完成原型开发。Codex 作为具备上下文感知能力的 AI,已成为该团队的协作伙伴。
OpenAI NewsAI 评分 OpenAI 分析指出 SWE-Bench Pro 编码评测存在可靠性问题
OpenAI 发布新分析,指出流行编码基准 SWE-Bench Pro 存在可靠性与准确性方面的问题。该分析揭示了这一用于评估 AI 模型的基准在评测中可能产生误导性结果。
OpenAI NewsAI 评分 Australian Payments Plus 如何用 ChatGPT 和 Codex 加速支付业务
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,实现节省时间、提升质量,同时保留人工判断。
Hugging Face BlogAI 评分
ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
AndrewYNg@AndrewYNgAI 评分
OpenAI NewsAI 评分 OpenAI 预告下一代模型 GPT-5.6 Sol
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。