OpenAI 发布 GPT-6.1 Sol,面向 ChatGPT Work 和 Codex 用户开放
OpenAI 发布 GPT-6.1 Sol,今日起向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。
推荐理由:原文给出 GPT-6.1 Sol 的定价与缓存输入成本,读者可据此比较它与 GPT-6 Sol、GPT-6 Astra 的性价比。
OpenAI 发布 GPT-6.1 Sol,今日起向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。
推荐理由:原文给出 GPT-6.1 Sol 的定价与缓存输入成本,读者可据此比较它与 GPT-6 Sol、GPT-6 Astra 的性价比。
OpenAI 发布 GPT-6.1 Sol,称其以 GPT-6 Astra 五分之一的成本提供接近 Astra 的智能水平,是当前同性能下最具成本效率的模型。缓存输入价格为每百万 token 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。
推荐理由:OpenAI 官方给出 GPT-6.1 Sol 的定价与缓存折扣,并说明它在编码、computer use 与对齐评测上的位置,便于判断成本与能力取舍。
OpenAI 发布 GPT-6.1 Sol,称其以五分之一的价格提供接近 Astra 的智能水平。OpenAI 表示,这是目前同等性能下最具成本效率的模型。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程,同时支持分类与回归。
推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树路线的差异。
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
ElevenLabs 发布 Eleven v4,称其覆盖 90+ 种语言,在日语、普通话、印地语等非拉丁文字语言上明显优于其他模型,并在这些语言的基准测试中稳定排名第一或接近第一。该模型同时针对加泰罗尼亚语、奥里亚语等地方语言做了优化,官方还表示未来几周将大幅提高免费使用额度。
我试用了 Kling 4.0 flash,没有让我失望! 与 Kling 3.0 相比,快速运动有了巨大提升! 干得漂亮 @Kling_ai
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后在讲解视频生成上表现突出,SimpleBench 达 88.4%,被 @skalskip92 评为 Anthropic 迄今最强视觉模型。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的思考预算与免费层表现,可据此了解它在编码任务上的定位与成本取舍。
一系列 Claude Sonnet 5.5 的早期实验推文串。 @_re_pete 制作的秋叶模拟器,用 Sonnet 5 与 Sonnet 5.5 对比。
ARC Prize 公布 OpenAI GPT-6 Sol 在 ARC-AGI 系列基准上的成绩:ARC-AGI-3 为 4.6%($5.6K,标准 harness)和 23.0%($8.7K,provider adapter harness),ARC-AGI-2 为 89.6%($0.44/task),ARC-AGI-1 为 95.5%($0.14/task)。
ARC Prize 公布测试结果,在 ARC-AGI-1 的 xhigh 推理档位下,GPT-6 Sol 得分 92.7%,GPT-5.6 Sol 为 97.5%。在匹配的推理档位上,GPT-6 Sol 每个任务的成本比 GPT-5.6 Sol 低 73%。完整结果见 arcprize.org/results/openai-gpt-6-sol。
ARC Prize 公布 OpenAI 的 GPT-6 Sol 在 ARC-AGI 系列基准上的成绩:ARC-AGI-3 在标准 harness 下为 4.6%。
Claude Sonnet 5.5 现已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并超过 Fable 5.1 的 extra high reasoning effort 表现。
推荐理由:Devin 上线 Claude Sonnet 5.5,并给出 FrontierCode 1.1 分数与成本变化,可据此判断编码智能体的性价比。
Cognition 宣布 Claude Sonnet 5.5 已在 Devin Desktop 和 Devin CLI 中可用,在 FrontierCode 1.1 Main 上得分 64.4%,高于 Sonnet 5 的 56.2%,并在 extra high reasoning effort 下超过 Fable 5.1。
推荐理由:Devin 上线 Claude Sonnet 5.5 并给出 FrontierCode 1.1 分数与 Sonnet 5 的对比,可据此判断编码智能体的模型选择。
Anthropic 推出 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5,相比 Sonnet 5 运行速度提升超过 30%,多数工作成本最多降低 30%。Boris Cherny 展示了该模型用 Claude Code 修复 bug 的场景,称速度快 30%、用量少 30%。
Claude Sonnet 5.5 发布。作者以 OpenAI 支持者口吻感叹 Claude 正夺走自己的偏好,并调侃 OpenAI 阵营家都被偷完了。
Anthropic 官方宣布 Claude Sonnet 5.5 现已可用(Claude Sonnet 5.5 is now available)。原文仅提供这一发布信息,未给出更多细节。
ElevenLabs 推出 Eleven v4,称其为旗下最具情感表现力的语音模型。官方同时上线了一个演示,展示该模型的情感跨度,其中 [audio tags] 可塑造每条提示词的情绪表达。
space bunny 已连续 5 天成为 opencode 上排名第一的模型,累计消耗 40T tokens。
可灵 Kling AI 宣布 Kling 4.0 将于 10 月发布,Kling 4.0 Flash 现已面向 Ultra 年度订阅用户开放。
Meta 在过去 6 个月陆续推出 Muse Spark、Muse Image、Muse Video、Muse Glimmer、Muse Code 等模型,并上线 Meta Model API。Muse Spark 已迭代至 1.1、1.2、1.3 版本,官方表示这仅仅是开始。
社区为 MiniCPM5-2B 构建了 EXL3 4-bit 量化版本,量化后模型权重仅 1.61 GB,采用 4.0 bpw 量化以缩小模型体积。该版本在 NVIDIA Tesla T4 上实测约 68–70 tokens/s,支持通过 ExLlamaV3 和 TabbyAPI 进行本地推理。
华为已开源 openPangu 2.0 的预训练、监督微调和强化学习后训练代码。该发布扩展了其开源 AI 模型计划,围绕昇腾硬件上的原生训练与推理构建,相关模型组件正逐步添加到开源平台。
H公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B Mixture of Experts 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 形式开源在 Hugging Face,同时发布 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机操作智能体的路线取舍。
面壁智能 OpenBMB 发布 MiniCPM5-2B,一款 2B 参数、主打本地小硬件运行的小模型,权重和训练数据均开源。有人将其接入 CI 修复 Agent,给它一个“结算重试导致运费重复计算”的 Bug,模型自行复现问题、翻代码、定位原因并打出补丁,18 个测试全部通过,全程本地运行。该模型在编程和工具调用能力上表现不错。
Sky Computing Lab 将 DJev 在 B200 上优化并部署,每次决策约 24 ms,最高可达每秒约 40 次。每次决策会一次性为所有动作打分并选出最优项,包括冲锋、侧移、绕圈、找掩体、筑墙、拉弓、布置岩浆陷阱、追求暴击和撤退。
MiniMax 宣布 MiniMax-M3.1 Flash Preview 已在 Token Plan 上线,主打更快更轻,面向高并发、对延迟敏感的工作负载,现有 Token Plan 订阅用户无需额外配置即可使用。同一账号还提到该文本模型当天在 MiniMax Code 首发,面向日常开发场景。
MiniMax 发布 M3.1-Flash-Preview,今日在 MiniMax Code 上线,官方称其智能更强、推理速度更快。该模型为 Flash 档位,目前尚未公布 benchmark 成绩,也未说明是否开源权重。
MiniMax 最新文本模型 M3.1-Flash-Preview 今日在 MiniMax Code 上线,面向日常开发场景,主打快速可靠,可处理快速修 bug 到完整功能开发。
美团 LongCat-2.5-Preview 在 OpenCode 上线,提供两周免费试用,支持 1M 上下文、多模态与零数据保留。用户可直接体验并分享构建成果。
Viggle AI 发布 Viggle Turbo v0.2,支持文生图和图像编辑,只需 6 步,比 40 步的 Qwen-Image-2.1 快约 5 倍。该版本已在 Hugging Face Spaces 上免费开放运行,并附有与 base 版本的对比。
Viggle AI 推出面向 Qwen-Image-2.1 的 viggle-turbo,称其不仅速度更快,在大多数提示词下生成质量与 base 版本相当。该消息由 Viggle AI 官方账号发布,并附有视频演示。
美团 LongCat 宣布每位现有用户可获 500 万免费 token,用于试用 LongCat-2.5-Preview,余额可在 longcat.ai/platform/usage 查询。所有已购 token 套餐同时兼容 LongCat-2.5-Preview 和 LongCat-2.0。用户可通过其 Discord 反馈问题。
美团 LongCat 宣布 LongCat-2.5-Preview 上线,总参数量 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态。官方称该模型面向长周期任务,覆盖终端、浏览器、GUI、表格和设计工具等场景,现已开放 API(longcat.ai/platform/)和 Chat(longcat.ai/chat/)入口。
推荐理由:官方给出参数量、激活规模与 1M 上下文等关键规格,可据此判断它在长任务场景的定位。
单台 DGX Spark 上实测多款模型的单用户推理速度,MiniCPM5-2B 作为 OpenBMB 的 drafter 达到 100.8 tok/s,Qwen3.6-35B-A3B 为 89.7 tok/s,Ling-3.0-flash 为 69.5 tok/s。