#端侧
#端侧
rohanpaul_ai@rohanpaul_aiAI 评分 Hugging Face Blog精选AI 评分
Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验版),在 Decision Index 0.2.1 上 d1-3B 得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B(47.11)。
推荐理由:原文给出决策指数得分与多设备延迟数据,读者可据此判断它在端侧结构化决策场景的可用性。
rohanpaul_ai@rohanpaul_aiAI 评分 Google 发布 EmbeddingGemma 2,一款采用 Apache 2.0 许可、面向端侧多模态 AI 的嵌入模型,可将文本、代码、图像、音频和视频映射到同一可搜索空间。
The DecoderAI 评分Google 发布 EmbeddingGemma 2 多模态嵌入模型
Google 发布开源嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为数值向量,参数量 740M,Google 称其在多模态嵌入基准上超过两倍体量的竞品。
Google DeepMind精选AI 评分Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、采用 Apache 2.0 许可的 740M 参数多模态嵌入模型,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数规模、内存占用和上下文长度等具体指标,读者可据此评估它是否适合自己的端侧检索场景。
osanseviero@osansevieroAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 Google DeepMind 发布 EmbeddingGemma 2,称这是其首个面向端侧嵌入的原生多模态开放模型。该模型从文本扩展到代码、图像、音频和视频,将这些内容统一到共享空间中。
Google@GoogleAI 评分 Google@GoogleAI 评分 Google@GoogleAI 评分 Google@GoogleAI 评分 Google 宣布 EmbeddingGemma 2 针对移动端和桌面端本地运行进行了优化。借助该模型,用户无需联网即可通过语音备忘录找到特定视频片段,或用简单文本查询搜索数小时的音频内容。
UnslothAI@UnslothAIAI 评分
thsottiaux@thsottiauxAI 评分 达到 50 TPS 而非 30 TPS,同时拥有目前最优化的 tokenizer。而且这些模型在完成任务所需的 token 数量方面相当高效!
Simon WillisonAI 评分 Qwen3.8 27B 本地模型英文单词加法评测:关闭推理准确率 23.57%,开启后 169 次答对 167 次
Simon Willison 在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 复现了 Colin Frasier 两年前用 GPT-4o 做的加法实验,让模型把正整数相加并仅用英文单词给出精确结果。
SemiAnalysis_@SemiAnalysis_精选AI 评分 我们此前在 WAIC 2026 总结中报道过真武 M890,当时更仔细地看了这款芯片的版图。真武 M890 芯片采用 4 组 HBM3E 12-Hi,配备 2 个计算 die。(2/3)
推荐理由:编辑精选:SemiAnalysis 报道给出真武 V900 的显存、互连规格及计划出货时间,便于跟踪国产 AI 算力进展;三倍性能属于厂商宣称,仍需独立实测验证。
SemiAnalysis_@SemiAnalysis_AI 评分
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 webAI 发布 3.6B 参数 TwIL-LM3-Pro,本地运行并开源
webAI 发布开源小模型 TwIL-LM3-Pro,仅 3.6B 参数,提供量化版本可在日常电脑本地运行,无需云端。其 BIG-Bench Hard 逻辑子集得分 95.4%,对比 VibeThinker-3B 的 61.1%;SVAMP 95%、MuSR 64.1%。
kim__minseon@kim__minseonAI 评分 AravSrinivas@AravSrinivasAI 评分 Perplexity CEO Aravind Srinivas 列出近期多个开源贡献:pplx-decider-v1-27b 多模态决策模型在 11 个基准平均 85.7%。
Davidstout@DavidstoutAI 评分
Meituan_LongCat@Meituan_LongCatAI 评分 0xBakeer@0xBakeerAI 评分
PatrickToulme@PatrickToulmeAI 评分 deepseek_ai@deepseek_aiAI 评分
OpenSquilla@OpenSquillaAI 评分 Alibaba_Qwen@Alibaba_QwenAI 评分 一个高性能 125B 模型现在仅用 75GB RAM 即可本地运行!感谢 @UnslothAI 的 day-0 支持。🥳
Google DeepMind精选AI 评分Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Gboard 与 Live Transcribe
Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。
推荐理由:SL2T 把多语言手语翻译从实验室带进 Gboard 与 Live Transcribe,读者可了解其数据规模与端侧隐私设计。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:三款模型分别覆盖全身控制、具身推理与端侧部署,读者可据此判断机器人智能层的分工方式。
Google DeepMind精选AI 评分Google DeepMind 发布 DiffusionGemma:文本扩散模型,推理速度最高提升 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,可据此判断本地交互式推理的可行边界。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型
Google DeepMind 发布 Gemma 4 12B,定位为可在笔记本本地运行的多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,并给出 16GB 显存本地运行的边界。
Hugging Face Blog精选AI 评分
H Company 发布 Holo3.1 系列 Computer Use Agent 模型
H Company 发布 Holo3.1 系列 Computer Use Agent 模型,基于 Qwen 家族,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:原文给出跨环境、跨框架与本地量化部署的具体数据,可据此判断端侧 Computer Use Agent 的落地条件。
TextoCriativo@TextoCriativoAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemma 4 开源模型家族,含 26B MoE 与 31B Dense 四种尺寸
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 给出四种尺寸、Apache 2.0 许可与完整工具链支持,可据此判断开源模型在端侧与本地部署上的能力边界。