Arena 发布本周榜单汇总,四个模型发布重塑了 Text、Code 和 Agent Arena 的 Pareto 前沿。
#Anthropic
#Anthropic
arena@arenaAI 评分 arena@arena精选AI 评分 推荐理由:原文给出了排名、净提升幅度与单任务成本的对比,读者可据此权衡新模型的能力增益与代价。
arena@arenaAI 评分 Replit@ReplitAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 trq212@trq212AI 评分 "You should know" 是紧跟 Claude 各种可能性的好方法,也是 mod 能实现的绝佳示例。 你真的可以让 Claude Code 变成你自己的。
ClaudeDevs@ClaudeDevsAI 评分 ClaudeDevs@ClaudeDevsAI 评分
The DecoderAI 评分Anthropic 联合创始人闭门会宗教领袖,称担心创造出「永久受苦」之物
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教与哲学学者到办公室讨论 Claude 是否可能具有意识,参与者均需签署保密协议,联合创始人 Christopher Olah 将模型视为潜在有感知的存在,请嘉宾帮它做「道德教育」。
testingcatalog@testingcatalogAI 评分
TechCrunch · AIAI 评分TechCrunch Equity 播客:只有 2% 消费者在为 AI 买单
TechCrunch Equity 播客本期讨论白宫 AI 安全承诺与"超级智能"行政令,以及消费级 AI 的经济账:只有 2% 消费者真正买单,AI 最大的钱仍来自企业市场。节目还谈及 Oura 撤回 IPO、Anthropic 泄露的 S-1、OpenAI 回归私募融资,以及 Quartermaster 1.4 亿美元融资、Atomic 已承接 DoorDash 90% 采购等交易。
TechCrunch · AIAI 评分白宫将 AI 正式更名为“超级智能”,并签署行政令
白宫本周召集 Zuckerberg、Bezos、Musk、Anthropic 的 Dario Amodei 等科技 CEO 签署 AI 安全承诺,Trump 称其“具有道德约束力”。Trump 同时签署行政令,正式将 AI 更名为“超级智能”。Meta 和 OpenAI 则在为自家 AI 产品塑造更亲和的形象,而 AI 领域最大的收入仍来自企业端。
AWS Machine Learning BlogAI 评分用 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全 Web Search
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
The Verge · AIAI 评分ChatGPT 模型幻觉正让顾客变得更难缠
餐厅、零售等一线服务人员反映,越来越多顾客拿 ChatGPT 的说法反驳专业建议,甚至无视过敏原警告。纽约服务员 Madison 称有客人坚持点含贝类的高汤鱼菜,理由是 ChatGPT 说没有贝类;酒侍也常被顾客用 ChatGPT 取代。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。
The DecoderAI 评分Mercor 研究:AI 在记账任务上速度与准确率超过持证会计师,但仍无法独立完成结账
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
The DecoderAI 评分Ramp AI Index:企业 AI 用量上升但支出下降
Ramp 经济学家 Ara Kharazian 发布的 Ramp AI Index 显示,美国企业 AI 支出自 7 月见顶后持续下降,而使用量自 7 月以来上升约 50%,并在 9 月底创下新高。
trq212@trq212AI 评分 一直在尝试提升我游戏原型的动画质量,所以让 Claude 教我并找参考资料。 我让 Claude 做了一个动画编辑器,这样我们就能迭代调整跳跃动作,我对最终效果非常满意。 这里有一个并排对比视频
bcherny@bchernyAI 评分 Claude 推出 Mods 功能,用户只需通过提示词即可自定义 Claude 的工作方式和外观,让每个人拥有不同的使用体验。Mods 还可以作为插件分享,供他人试用。
AnthropicAI@AnthropicAIAI 评分 Simon WillisonAI 评分 pwasm 0.2a0 发布:Claude Opus 5.5 改造纯 Python WebAssembly 引擎
pwasm 0.2a0 发布,这是作者用纯 Python 编写的 WebAssembly 引擎,最初于 1 月 vibe-coded 完成。
thexpin@thexpinAI 评分 OpenAI 称有超过 15,000 个账号试图提取其模型的推理过程,并把一个核心群体与 Kimi 开发商 Moonshot AI 的关联人员联系起来;Anthropic 在 2 月也提出过类似指控。
arena@arenaAI 评分 dfeinition@dfeinitionAI 评分 dotey@doteyAI 评分 dongxi_nlp@dongxi_nlpAI 评分 ClaudeDevs@ClaudeDevsAI 评分 Claude.dev 是我们为使用 Claude 构建的开发者打造的新主页。 你将在这里找到工程深度解析、Claude Code 和 API 指南、Claude 构建团队的技巧,以及一些有趣的彩蛋。
claudeai@claudeaiAI 评分 报名旧金山:anthropic.com/events/claude-… 报名斯德哥尔摩:anthropic.com/events/claude-…
claudeai@claudeaiAI 评分
Ars Technica · AIAI 评分特朗普推动AI企业自愿安全承诺,白宫协议被称道德约束
特朗普与二十余家AI企业达成自愿协议,企业承诺实施白宫建议的管控措施,包括接受独立安全审计,审查网络安全、生物安全、化学威胁及AI模型意外行为等风险,并定期会面制定共同安全标准与基准。
yan5xu@yan5xuAI 评分 作者推荐 Latent Space 一期 92 分钟播客,嘉宾是 Claude Code 的 Thariq,信息密度高。
frxiaobei@frxiaobeiAI 评分 Anthropic 发布文章评估智谱 GLM-5.3 的网络攻击能力,按其测试 GLM-5.3 在 Chrome V8 漏洞利用任务中的成功率接近 Claude Mythos Preview。
Latent Space精选AI 评分OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol、Ultrafast 与 Decisions API
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总了 OpenAI DevDay 2026 的发布清单与第三方评测数据,可快速了解各家模型在成本与能力上的相对位置。
AWS Machine Learning BlogAI 评分Amazon Bedrock 将 Claude Opus 5、Sonnet 5、Haiku 4.5 引入印度境内推理
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过印度地理跨区域推理让数据仅在 ap-south-1 与 ap-south-2 之间流转。
AWS Machine Learning BlogAI 评分Amazon Bedrock 在首尔和新加坡推出 Anthropic Claude 模型区域内推理
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5 进行区域内推理,请求与数据全程不离开所调用的 Region。
hongming731@hongming731AI 评分 BestBlogs 09-30 早报汇总 10 条 AI 资讯,涵盖 OpenAI 2026 开发者大会(Dots、ChatGPT Space、Decisions API。
X:洪明 (@hongming731)AI 评分 BestBlogs 早报 · 09-30|OpenAI DevDay 2026 大会,Manus 2.0 推出 Cue,Claude Sonnet 5.5 降低任务成本
BestBlogs 早报 09-30 期汇总三条动态:OpenAI 举办 DevDay 2026 大会,Manus 2.0 推出 Cue,Claude Sonnet 5.5 降低任务成本。BestBlogs.dev 是 AI 驱动的私人阅读助手,该早报面向所有用户,也可基于个人兴趣和阅读习惯定制「我的早报」。
trq212@trq212AI 评分 from our blog post on how we made Claude faster: claude.dev/blog/how-we-made-…
trq212@trq212AI 评分