#编码
#编码
arena@arenaAI 评分
OpenRouter@OpenRouterAI 评分 AntLingAGI@AntLingAGIAI 评分 保持冷静,与我们的 day0 合作伙伴 @vercel_dev 一起构建 🤘 再享受一周 Ling-3.1-flash,一个 token 高效、擅长智能体和编码的模型~
The DecoderAI 评分Anthropic 发布 Claude Haiku 5.5,价格较 Haiku 4.5 大幅下调
Anthropic 发布 Claude Haiku 5.5,称其为迄今最快、最便宜的小模型,平均价格比 Haiku 4.5 低约 75%,100,000 tokens 以内的请求价格最多降 90%,超过 100,000 tokens 的请求价格为 5 倍。
cursor_ai@cursor_aiAI 评分 testingcatalog@testingcatalogAI 评分 arena@arenaAI 评分
Ars Technica · AIAI 评分Mistral 发布 1 万亿参数开源模型 Mistral Large 4,称可比肩顶尖模型
法国公司 Mistral 发布 1 万亿参数模型 Mistral Large 4(昵称 Le Chonk),称其可与美中顶尖模型竞争,目前处于预览阶段,正式版将于月底前推出。
Hugging Face Blog精选AI 评分
Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平
NVIDIA 官方博客称,基于 Nemotron 3 用 SFT、RL 与反馈式推理特化的系统在 IOI 2026 与 IMO 2026 均达金牌水平:Nemotron-3-Ultra-CC 得 535.4/600,超过 361.12 的金牌线与人类最高分 498.27;IMO 系统得 30/42,超过官方金牌线 29。
推荐理由:原文给出从基座到数据再到推理循环的四步特化配方,读者可据此评估复现金牌级系统的成本与路径。
reflection_ai@reflection_aiAI 评分 cb_doge@cb_dogeAI 评分 elonmusk@elonmuskAI 评分
b_roziere@b_roziereAI 评分 Mistral AI精选AI 评分
Mistral AI 公开预览 Mistral Large 4,月底开放权重
Mistral AI 宣布 Mistral Large 4(非正式代号 le Chonk)进入公开预览,可在 Mistral Studio 使用预览 API,权重将于本月底发布。
推荐理由:原文给出参数规模、开放权重时间表和多组基准成绩,读者可据此评估其与现有开源模型的差距。
The DecoderAI 评分Reflection 发布开源模型 Beam,主打低算力下的编码与智能体能力
AI 公司 Reflection 发布首个免费开放模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务,以更低算力对标 DeepSeek 和 Qwen 等中国开源模型。
Latent SpaceAI 评分Reflection 发布 501B-A23B 开源模型 Beam,主打编码与智能体任务
Reflection 宣布推出 Beam,一个 501B 总参数 / 23B 激活参数的纯文本 MoE 模型,面向编码、智能体和科学任务,从零训练,完整权重采用 Apache 2.0 并将于本月发布。
TechCrunch · AIAI 评分Reflection 发布开源权重模型 Beam,称以更低成本对标中国模型
Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上比肩 Z.ai 的 GLM-5.2 等中国领先开源模型,且推理算力消耗低 3-4 倍。
CommandCodeAI@CommandCodeAIAI 评分
ArtificialAnlys@ArtificialAnlysAI 评分 arena@arenaAI 评分
arena@arenaAI 评分 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第一,在 Code Arena: WebDev 以 1679 分排名第八。
Ars Technica · AIAI 评分Google 发布 Gemini 4 Argon 模型,暂未对外开放使用
Google 发布 Gemini 4 Argon 模型,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部有限测试,外部用户尚不能使用。
GoogleAI@GoogleAI精选AI 评分 推荐理由:原文说明了该模型面向的三类复杂工作流场景和输出上限,读者可据此判断它对长任务工作流的适配程度。
Google@Google精选AI 评分 Google 宣布 Gemini 4 Argon 是其前沿智能的下一个时代,在多项基准测试上取得显著提升,并在真实世界的长程软件工程任务上树立了新的 state of the art。
GoogleDeepMind@GoogleDeepMindAI 评分 sundarpichai@sundarpichaiAI 评分
OpenAI News精选AI 评分 OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
ClaudeDevs@ClaudeDevsAI 评分 bcherny@bchernyAI 评分
Ronny_MiniMax@Ronny_MiniMaxAI 评分 MiniMaxAgent@MiniMaxAgentAI 评分 MiniMax 最新文本模型 M3.1-Flash-Preview 今日在 MiniMax Code 首发。 面向日常开发打造,快速、可靠,可投入实际工作,从快速修复 bug 到完整功能开发。
Meituan_LongCat@Meituan_LongCatAI 评分
Latent Space精选AI 评分Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并降价 40-50%
Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:汇总了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格、基准与第三方评测数据,便于横向比较两家新模型的定位差异。
SpaceXAI@SpaceXAIAI 评分 Grok 4.7 现已在 Cursor、Grok Build 和 Grok API 上线,官方提供了更多信息链接 x.ai/news/grok-4-7。
SpaceXAI@SpaceXAIAI 评分