#部署/工程
#部署/工程
HuggingPapers@HuggingPapersAI 评分
SemiAnalysis_@SemiAnalysis_精选AI 评分 我们此前在 WAIC 2026 总结中报道过真武 M890,当时更仔细地看了这款芯片的版图。真武 M890 芯片采用 4 组 HBM3E 12-Hi,配备 2 个计算 die。(2/3)
推荐理由:编辑精选:SemiAnalysis 报道给出真武 V900 的显存、互连规格及计划出货时间,便于跟踪国产 AI 算力进展;三倍性能属于厂商宣称,仍需独立实测验证。
TechCrunch · AIAI 评分AWS 发布开源决策模型 Strands Decider 2B,对标 TypeSafe 的 Jev
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
ViggleAI@ViggleAIAI 评分
The DecoderAI 评分Cloudflare 发布 Clef 与 Clef-flash 决策模型,主打低延迟智能体决策
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
Hugging Face BlogAI 评分
Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
Simon WillisonAI 评分 TypeSafe AI 发布 Jev:只输出浮点决策的 System One 模型
TypeSafe AI 发布 Jev,这是其称为 System One 的新类别模型,输入文本后不输出文本,而是返回类别、是/否判断、评分及对应置信度的浮点数。
MiniMax_AI@MiniMax_AIAI 评分
Alibaba_Qwen@Alibaba_QwenAI 评分 一个高性能 125B 模型现在仅用 75GB RAM 即可本地运行!感谢 @UnslothAI 的 day-0 支持。🥳
Hugging Face BlogAI 评分
IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三档
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,全部以 Apache 2.0 许可开源。
Hugging Face Blog精选AI 评分
Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在 GPU 上最高提升 3.18 倍吞吐、端侧最高 2.87 倍,且不改变输出质量。
推荐理由:Liquid AI 给出三款 LFM2.5 草稿模型的实测吞吐与函数调用延迟数据,可据此判断端侧推理的可用性。
OpenAI News精选AI 评分 OpenAI 下调 GPT-5.6 在 Luna 和 Terra 上的价格
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的价格,并介绍其更高效的模型如何帮助企业规模化部署 AI 工作流。
推荐理由:OpenAI 下调 GPT-5.6 在 Luna 与 Terra 上的价格,读者可据此重新估算企业级 AI 工作流的部署成本。
Mistral AI精选AI 评分
Mistral 发布 OCR 4,支持边界框、块分类与置信度分数
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。
推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。
Hugging Face Blog精选AI 评分
PP-OCRv6 上线 Hugging Face:1.5M 到 34.5M 参数、支持 50 种语言
PaddleOCR 发布新一代通用 OCR 模型家族 PP-OCRv6,已在 Hugging Face 上线,提供 tiny、small、medium 三档,参数量从 1.5M 到 34.5M,其中 small 和 medium 支持 50 种语言。
推荐理由:原文给出三档模型参数、检测与识别指标及多后端接入方式,便于按部署场景选型。
Hugging Face Blog精选AI 评分
H Company 发布 Holo3.1 系列 Computer Use Agent 模型
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
Hugging Face Blog精选AI 评分
JetBrains 发布 12B MoE 模型 Mellum2,Apache 2.0 开源
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face Blog精选AI 评分
H Company 发布 Holotron-12B 计算机操作智能体模型
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,已在 Hugging Face 上线,采用 NVIDIA Open Model License。
推荐理由:原文给出混合 SSM 架构带来的吞吐对比数据与 WebVoyager 提升幅度,可据此判断计算机操作智能体的部署成本。
Hugging Face Blog精选AI 评分
Overworld 发布实时交互视频扩散模型 Waypoint-1
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。
推荐理由:Waypoint-1 把实时交互式视频扩散模型和推理库一并开源,读者可据此了解世界模型从控制输入到消费级硬件落地的路径。
Mistral AI精选AI 评分
Mistral 发布 OCR 3 文档解析模型
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方给出与 Mistral OCR 2 的胜率对比、每千页定价和自托管选项,便于评估文档解析成本与合规。
Mistral AIAI 评分
Mistral 发布代码嵌入模型 Codestral Embed
Mistral AI 发布首款专为代码设计的嵌入模型 Codestral Embed,在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI精选AI 评分
Mistral AI 发布 Mistral Medium 3,主打低成本企业部署
Mistral AI 发布 Mistral Medium 3,定位兼顾 SOTA 性能与更低成本,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,便于判断企业自部署的性价比。
Mistral AI精选AI 评分
Mistral 发布区域语言模型 Mistral Saba,24B 参数支持阿拉伯语和印度语系
Mistral AI 发布 Mistral Saba,这是其首个专门面向区域语言的模型,24B 参数,基于中东和南亚地区精选数据集训练。官方称其回答比体积超过自身 5 倍的模型更准确相关,速度更快、成本更低,可在单 GPU 系统上部署,响应速度超过 150 tokens per second,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤其突出。
推荐理由:Mistral 首个区域语言模型给出 24B 参数、单 GPU 部署与 150 tokens/s 速度,可对照其区域化路线。
Mistral AI精选AI 评分
Mistral AI 发布 Codestral 25.01 代码模型,生成速度提升约 2 倍
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度从 32k 提升到 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在代码补全场景的位置。
Hugging Face Blog精选AI 评分
Llama 3.1 发布:8B、70B、405B 三尺寸,支持 128K 上下文与多语言
Meta 发布 Llama 3.1 系列,包含 8B、70B、405B 三个尺寸的 base 与 instruct 版本共六个开放权重模型,均支持 128K token 上下文和英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语 8 种语言,并新增工具调用能力。
推荐理由:Hugging Face 官方梳理了 Llama 3.1 三个尺寸的显存需求、量化方案与微调路径,可据此估算部署成本。
Mistral AI精选AI 评分
Mistral AI 发布开源稀疏 MoE 模型 Mixtral 8x7B
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数量 46.7B,但每个 token 只使用 12.9B 参数,因此在同等速度与成本下运行,推理速度比 Llama 2 70B 快 6 倍,并在多数基准上匹配或超过 GPT3.5。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比取舍。
Mistral AI精选AI 评分
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地、云端(AWS/GCP/Azure)及 HuggingFace 部署。
推荐理由:Mistral 7B 以 Apache 2.0 开源并给出与 Llama 2 系列的逐项对比,读者可据此判断小参数模型的性价比位置。