Ideogram 发布 Ideogram 4.5,称可局部编辑图像而不影响其余画面
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,替换服装时人物身形与背景保持不变,可减少多次编辑后的画面瑕疵。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,替换服装时人物身形与背景保持不变,可减少多次编辑后的画面瑕疵。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
Claude Sonnet 5.5 以 xHigh 推理模式进入 Code Arena: WebDev,得分 1786 分排名第 3,混合价格 $8/M tokens。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
OpenAI 的 Tibo 表示,GPT-6.1 Sol 在 API 和订阅两端的需求量几乎是历来最高的,ChatGPT 与 Codex 中负载很重。团队已上线更多算力,未来数小时速度应会明显改善,接近昨天服务速度的两倍。
ARC Prize 公布了 OpenAI GPT-6.1 Sol 在 ARC-AGI 上的完整测试结果,并同步开放排行榜、公开结果复现仓库与测试政策。相关结果可通过 arcprize.org 的排行榜页面及 GPT-6.1 Sol 专属结果页查看,复现脚本托管于 GitHub 的 arc-agi-benchmarking 仓库。
ARC Prize 公布 OpenAI 的 GPT-6.1 Sol 在 ARC-AGI 上的验证成绩:ARC-AGI-3 在标准 harness 下为 52.7%。
推荐理由:ARC Prize 给出 GPT-6.1 Sol 在三代 ARC-AGI 上的成绩与单任务成本,可对比其与 GPT-6 Astra 的性价比差异。
ARC Prize 称 GPT-6.1 Sol 在 ARC-AGI-3 上提高推理档位后决策更优,完成关卡所需动作更少,从而降低了总推理成本。在 sk48 上,使用 provider adapter(保留跨轮不透明推理状态并支持自动压缩)时,max reasoning 的 GPT-6.1 Sol 以 463 个动作完成游戏,而 low reasoning 用了 1,078 个。
Simon Willison 发布博文《GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price》,讨论 GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。原文未披露参数规模、benchmark 分数或具体定价等细节。
GPT-6.1 Sol 现已在 Devin 中可用。在 FrontierCode 1.1 上,GPT-6.1 Sol 得分 60.4%,与 GPT-6 Sol 的 60.7% 基本持平,但成本大幅降低:中等推理强度下每任务 0.31 美元,比 GPT-6 Sol 最高强度便宜 81%。
Cognition 宣布 GPT-6.1 Sol 已在 Devin 中可用。在 FrontierCode 1.1 上,GPT-6.1 Sol 得分 60.4%,与 GPT-6 Sol 的 60.7% 基本持平,但中等推理强度下每任务成本 0.31 美元,比 GPT-6 Sol 最高强度便宜 81%。
OpenAI 发布 GPT-6.1 Sol,今日起向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。
推荐理由:原文给出 GPT-6.1 Sol 的定价与缓存输入成本,读者可据此比较它与 GPT-6 Sol、GPT-6 Astra 的性价比。
OpenAI 发布 GPT-6.1 Sol,称其以 GPT-6 Astra 五分之一的成本提供接近 Astra 的智能水平,是当前同性能下最具成本效率的模型。缓存输入价格为每百万 token 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。
推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定价与缓存折扣,并说明它在编码、computer use 与对齐评测上的位置,便于判断成本与能力取舍。
OpenAI 发布 GPT-6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平。OpenAI 表示,这是目前同等性能下最具成本效率的模型。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的思考预算与免费层表现,可据此了解它在编码任务上的定位与成本取舍。
ARC Prize 公布 OpenAI GPT-6 Sol 在 ARC-AGI 系列基准上的成绩:ARC-AGI-3 为 4.6%($5.6K,标准 harness)和 23.0%($8.7K,provider adapter harness),ARC-AGI-2 为 89.6%($0.44/task),ARC-AGI-1 为 95.5%($0.14/task)。
ARC Prize 公布测试结果,在 ARC-AGI-1 的 xhigh 推理档位下,GPT-6 Sol 得分 92.7%,GPT-5.6 Sol 为 97.5%。在匹配的推理档位上,GPT-6 Sol 每个任务的成本比 GPT-5.6 Sol 低 73%。完整结果见 arcprize.org/results/openai-gpt-6-sol。
ARC Prize 公布 OpenAI 的 GPT-6 Sol 在 ARC-AGI 系列基准上的成绩:ARC-AGI-3 在标准 harness 下为 4.6%。
美团 LongCat-2.5-Preview 在 OpenCode 上线,提供两周免费试用,支持 1M 上下文、多模态与零数据保留。用户可直接体验并分享构建成果。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,并在能力与成本之间提供不同的平衡组合。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、computer use 以及更强的写作与设计判断力。
推荐理由:官方给出 GPT-6 Astra 的定位与三项能力方向,可据此了解 OpenAI 面向企业场景的模型迭代重点。
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型。官方表示该模型在计算机操作、编码、网络安全和科学领域具备 SOTA 能力。
推荐理由:OpenAI 官方公布 GPT-6 Astra 的发布信息,读者可据此了解新模型在计算机操作、编码等方向的能力定位。
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 首次公开 GPT-6 Astra 在 Preparedness Framework 下达到网络安全关键等级,读者可了解其能力定位与安全评估口径。
OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,因此发布时配备了更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛设定。
GPT-5.6 现已在 Kiro 中可用,帮助开发者完成软件的规划、构建、审查与测试,并带来更好的性价比。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于授权漏洞研究、漏洞利用验证和安全测试。
推荐理由:OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,读者可了解其面向授权漏洞研究的定位与开放渠道。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,提升了准确性和一致性。同时,OpenAI 扩大了 GPT-5.6 Luna 的访问范围,免费用户可进行无限日常对话。
推荐理由:OpenAI 在 ChatGPT 中改进 GPT-5.6 Sol 的准确性与一致性,并向免费用户开放 GPT-5.6 Luna。
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的价格,并介绍其更高效的模型如何帮助企业规模化部署 AI 工作流。
推荐理由:OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的价格,读者可据此重新估算企业级 AI 工作流的部署成本。
OpenAI 发布文章说明 GPT-5.6 如何在前沿智能与效率之间取得平衡,称其在模型、推理和智能体工作流上提升了 AI 效率,让每美元能获得更多有用智能。原文未给出具体性能数字或版本细节。
推荐理由:原文说明 GPT-5.6 在模型、推理与智能体工作流上提升效率,读者可据此了解其单位成本下的能力取向。
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈提升 AI 安全、对齐与提示词注入鲁棒性。该系统面向红队测试场景,用于自动发现模型弱点并驱动鲁棒性自我改进。
OpenAI 宣布 GPT-5.6 成为 Microsoft 365 Copilot 的首选模型,为 Word、Excel、PowerPoint、Chat 和 Cowork 提供更强的 AI 能力,以实现更快、更高质量的工作。
推荐理由:OpenAI 官方说明 GPT-5.6 成为 Microsoft 365 Copilot 首选模型,读者可了解其在 Word、Excel 等应用中的能力变化。
OpenAI 发布 GPT-5.6,官方称其在每个 token 上提供更高智能、每美元更强性能,并可按需为高难度任务提供更多能力。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互,目前已用于驱动 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型 GPT-Live,读者可了解它已接入 ChatGPT Voice 这一落地位置。
OpenAI 预告下一代模型 GPT-5.6 Sol,在编码、科学和网络安全方面具备更强能力。该模型同时搭配 OpenAI 目前最先进的安全栈。
OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学专长、基因组分析与实验工作流能力。
推荐理由:OpenAI 公布 GPT-Rosalind 在生物推理、药物化学与基因组分析上的能力扩展,读者可据此了解该模型在生命科学场景的定位。
OpenAI 表示其模型解决了有 80 年历史的单位距离问题,推翻离散几何中的一个重要猜想,被视为 AI 驱动数学的一个里程碑。
推荐理由:OpenAI 模型推翻离散几何中一个长期猜想,读者可了解 AI 在数学证明上的进展。