#部署/工程
#部署/工程
SemiAnalysis_@SemiAnalysis_AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 vLLM 中的门控测试是 vLLM 测试中要求最高的之一。话虽如此,AMD 仍有超过 11 个完整测试组尚未达到同等水平,但预计很快就能追平。(2/3)
SemiAnalysis_@SemiAnalysis_AI 评分
X:Rohan Paul (@rohanpaul_ai)AI 评分 Cerebras CEO 解释晶圆级架构为何在 LLM 推理中比 GPU 快 2500 倍
Cerebras 联合创始人兼 CEO Andrew Feldman 解释,其晶圆级架构在 LLM 推理的 decode 阶段比 GPU 快约 2500 倍。
X:Peter Steinberger (@steipete)AI 评分 Peter Steinberger:Apple 新开发者协议导致其全部开源发布停摆,Linux/Windows 版本一并被锁
Peter Steinberger 称其所有开源发布因 Apple 上线新开发者协议而停摆,由于发布流程 lockstep 绑定,Linux/Windows 版本也被一并阻断。评论指出,一个平台专属的协议签署成了跨平台发布的单点故障,有人建议拆分发布任务,但认为真正的解法是在发布前就检测到该阻塞。
X:Peter Steinberger (@steipete)AI 评分 Peter Steinberger:btrfs COW 适合 worktrees 但对 sqlite 有害,下个 OC 更新将迁移数据库到 NOCOW 位置
Peter Steinberger 发现 btrfs 的 COW 特性对 worktrees 很好,但对 sqlite 很糟糕。下一个 OC 更新将识别这一情况,并把数据库迁移到 NOCOW 位置。
dongxi_nlp@dongxi_nlpAI 评分 马东锡 NLP 建议 A4-A5 层级的用户暂缓入手 nvidia DGX Spark,认为单点 RTX、DGX Spark 等单品会让人误以为可以轻松进入该层级。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis 复测 Lambda:ClusterMAX 2.0 可靠性改进与 XID 79 未监控问题
SemiAnalysis 在 ClusterMAX 2.0 复测中指出,Lambda 的被动健康检查自动修复了测试中模拟的三个错误,两个合成 XID 在 15 分钟内被自动修复,并有配套仪表盘监控节点健康。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis:定制 HBM 可将 Nvidia Rubin 计算芯片的 HBM4 控制器与 PHY 占用面积减少约 60%
SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积。定制 HBM 用紧凑 D2D 链路替代标准 PHY,Samsung 数据显示其标准 HBM4 PHY 占 8mm x 4mm,定制 D2D 接口仅需 8.5mm x 1.5mm,面积减少约 60%,同时内存控制器从计算芯片移至 HBM base die。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis:定制 HBM 可将 HBM4 控制器与 PHY 占用面积减少约 60%
SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积,定制 HBM 可将这部分空间还给计算或缓存。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis:HBM4 控制器与 PHY 约占 Nvidia Rubin 计算die 16%
SemiAnalysis 估算,HBM4 控制器和 PHY 约占 Nvidia Rubin 计算 die 的 16%,大量先进制程面积被用于与内存通信而非计算。
SemiAnalysis_@SemiAnalysis_AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Qodo 3.0 发布 PR Triage:为编码智能体跨仓库 PR 提供整体审查
Qodo 推出 Qodo 3.0,新增 PR Triage 功能,将编码智能体跨不同仓库产生的相关 PR 归组为一个工作包,并按代码库影响、SLA 和未决问题打分。跨仓库地图展示工作包涉及的每个仓库,每项评分附有自身推理依据,Qodo 为整个工作包生成一份审查简报,让审查者一起审查 PR,人类仍负责最终批准代码。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Elvis Saravia 建议自建 meta harness 以便平滑切换模型
DAIR.AI 的 Elvis Saravia 建议开发者自建 meta harness,最大好处是能在不同模型间平滑切换。他认为随着模型发布周期缩短,这一点愈发重要,RSI 只会让发布进一步加速。切换模型不应破坏现有配置,若会破坏,说明你的设置不适应当前的发布节奏,需要尽快修复。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta 等提出 Context Language Models:让模型用 Bash 编辑自身上下文
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Onepin 推出 AI 语音质检层:逐行检查发音,只修错词不重录
Onepin 发布 AI 语音质检层,在文本转语音之后逐行检查配音,用 400 万词发音词典核对人名与产品名,并提前拼读价格和日期。它按自然度、清晰度和词准确率给每行音频打分,出错时只修复那个词、不重新渲染整段。该工具兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费起步、无需信用卡。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Volantis 用光学技术破解 AI 内存瓶颈,目标单用户 10000 tokens/秒推理速度
Volantis 完成 8800 万美元 A 轮融资,通过光学技术为每颗芯片提供更大容量和更高带宽的内存,目标在超过 10T 参数的模型上实现每用户最高 10000 tokens/秒的推理速度。该方案旨在解决 AI 内存瓶颈,初期可让原本耗时数小时的编程智能体在几分钟甚至几秒内完成。团队曾参与首款 CoWoS 产品、早期 HBM 及首款硅光 CPO 系统等半导体技术研发,下一代产品已完成流片。
AWS Machine Learning BlogAI 评分uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署生产
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
AWS Machine Learning BlogAI 评分如何在 AWS 上为 Claude Platform 实现多环境访问
面向 Claude Platform on AWS(CPonAWS),文章给出在专用 AI Services 账户中部署订阅、并用三种方式接入推理的完整步骤:AWS 工作负载账户通过跨账户 SigV4 免密钥调用,开发者笔记本使用绑定开发工作区的 API key,外部环境通过 OIDC 联合获取短期凭证。
semiDL@semiDLAI 评分
TechCrunch · AIAI 评分AWS 发布开源决策模型 Strands Decider 2B,对标 TypeSafe 的 Jev
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
ViggleAI@ViggleAIAI 评分 OpenRouter@OpenRouterAI 评分 OpenRouter@OpenRouterAI 评分 新增的安全标签页可查看所有工作区的 API 密钥。 可按风险、所有者或不活跃状态筛选。 可对密钥设置限额、禁用,或单个/批量归档。
OpenRouter@OpenRouterAI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 cohere@cohereAI 评分 perplexitydevs@perplexitydevsAI 评分
The DecoderAI 评分Cloudflare 发布 Clef 与 Clef-flash 决策模型,主打低延迟智能体决策
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
fchollet@fcholletAI 评分 OpenAI NewsAI 评分 GPT-6 系列模型选型指南
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
GoogleAI@GoogleAIAI 评分 MIT Technology Review · AIAI 评分
以自主 AI 重新定义企业智能
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增长收入。报告称领先企业把流程重设计置于模型选型之前,并强调数据就绪而非数据规模,主张以主权、可组合的架构在数据原地查询与准备数据,供 AI 智能体直接行动。
AWS Machine Learning BlogAI 评分用 Amazon Quick 与 Adjudicated Query 模式批量审查数千份租约合规性
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
AWS Machine Learning BlogAI 评分用 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全 Web Search
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内,无需外部 API key。
AWS Machine Learning BlogAI 评分在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。