Token 降价反而推高 AI 需求,成 Jensen Huang 最佳情景
Ornn、Silicon Data 和 Bloomberg 截至 2026 年 8 月的数据显示,a16z 称 AI 市场出现教科书式的 Jevons 悖论:token 价格持续下跌,而 H100 GPU 租金保持稳定或上涨,因为更便宜的 token 催生了 AI 智能体、自动化和新应用,使用量增速超过单位成本降幅。
Ornn、Silicon Data 和 Bloomberg 截至 2026 年 8 月的数据显示,a16z 称 AI 市场出现教科书式的 Jevons 悖论:token 价格持续下跌,而 H100 GPU 租金保持稳定或上涨,因为更便宜的 token 催生了 AI 智能体、自动化和新应用,使用量增速超过单位成本降幅。
AWS Machine Learning Blog 发布文章,提出 Agentic Value Model,指出传统 RPA 时代按省时数乘人工成本的 ROI 模型无法覆盖智能体自动化创造的价值。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举办,围绕开源与闭源 AI 的选择安排四场对话,涵盖多模型应用、自建或定制模型、前沿 API 与 open-weight 模型的权衡,以及 AI 设计芯片硬件。
Cerebras 联合创始人兼 CEO Andrew Feldman 解释,其晶圆级架构在 LLM 推理的 decode 阶段比 GPU 快约 2500 倍。
马东锡 NLP 建议 A4-A5 层级的用户暂缓入手 nvidia DGX Spark,认为单点 RTX、DGX Spark 等单品会让人误以为可以轻松进入该层级。
SemiAnalysis 估算,HBM4 控制器和 PHY 约占 Nvidia Rubin 计算 die 的 16%,大量先进制程面积被用于与内存通信而非计算。
DAIR.AI 的 Elvis Saravia 建议开发者自建 meta harness,最大好处是能在不同模型间平滑切换。他认为随着模型发布周期缩短,这一点愈发重要,RSI 只会让发布进一步加速。切换模型不应破坏现有配置,若会破坏,说明你的设置不适应当前的发布节奏,需要尽快修复。
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。
NVIDIA 提出 AI 工厂的回报取决于盈利、耐用、通用三大特性,其平台通过全栈协同设计实现最高每兆瓦吞吐与最低 token 成本。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐较 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 模型上每百万 token 成本最高降低 45 倍。
HPE 提出,当 AI 从试验走向生产、需求变得稳定且关键业务化后,按 token 逐次消费的模式会让 AI 支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
我们希望构建一个推理框架,其优化在生效时和因条件变化而失效时都能得到解释。这也是我希望我们更多人在 SGLang Omni 中共同承担的工程实践。
郭明錤指出MediaTek最新公告反复使用rack-scale一词,验证了他两个多月前研究的核心结论:MediaTek已将AI业务战略定位从IC / ASIC设计升级为系统级设计。
Hugging Face 博客指出,AI 的下一个真正约束不是智能而是 GPU 利用率:GPU 成本按日历小时累积,产出却只按计算小时计,因此两家 GPU 预算相当的公司会因利用率差异而拉开经济性差距。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体设计的数据系统、运行智能体集群的数据系统、以及由智能体合成的数据系统。在 text-to-SQL 基准上,多智能体尝试同一任务时仅 10-20% 子计划不同,80-90% 子查询存在重复计算。
Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上写出被维护者称为首个真正且最快的 megakernel。
Hugging Face 博客提出,企业 AI 规模化落地的关键不在 LLM 本身,而在"Agent 逻辑"——即知识图谱、算法、程序分析库等运行于智能体层的软件原语,可引导 LLM 聚焦企业工作流、压缩上下文空间。
中国开源模型社区已近乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。开源活动从文本扩展到多模态与智能体,StepFun 的 Step-Audio-R1.1 语音模型性能超越闭源模型,腾讯开源 Hunyuan Video 与 Hunyuan 3D。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,芯片稀缺也促使 DeepSeek 的 MLA、GRPO 等算力效率创新走向开源。
推荐理由:梳理中国算力从被限制到自建全栈的路径,帮助读者理解开源模型与国产芯片如何互相推动。
Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了与 Leandro von Werra 合著的《NLP with Transformers》,并讲述了自己从 2018 年使用 pytorch-pretrained-bert 到加入 Hugging Face 的经历。