#部署/工程
#部署/工程
rohanpaul_ai@rohanpaul_aiAI 评分
rohanpaul_ai@rohanpaul_aiAI 评分
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta 等提出 Context Language Models:让模型用 Bash 编辑自身上下文
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
Hugging Face BlogAI 评分
ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
Microsoft ResearchAI 评分 微软研究院用机器学习预测电网空间天气风险
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
MSFTResearch@MSFTResearchAI 评分 Microsoft Research精选AI 评分 微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航
微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。
Hugging Face BlogAI 评分
Hugging Face 论文:用离线 Top-K Logits 与融合分块 KL 损失降低 LLM 知识蒸馏成本
Hugging Face 最新论文提出两项系统改动,让 LLM 知识蒸馏成本大幅下降:先离线缓存教师模型的 top-100 logits,使教师模型无需与学生模型同时驻留显存;再用融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
Berkeley AI ResearchAI 评分
从 CUDA 到 MLX:K-Search 如何把数十年 kernel 经验带到 Apple Silicon
Berkeley Sky Lab 与 IBM Research 将演化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA kernel 知识迁移到 Apple Silicon。
Google ResearchAI 评分Google Research 如何用 Google Maps 路线干预缓解城市交通拥堵
Google Research 在 10 座美国城市开展大规模实验,通过修改 Google Maps 算法将不到 2% 的行程引导至拥堵路段之外的替代路线,使目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。
Google ResearchAI 评分Google 用线性弹性缓存优化云成本,Spanner 内存用量降 15.5%
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存用量降低 15.5%、缓存未命中仅增加 5.5%、TCO 降低约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时仍由 LRU 兜底,并在多个公开缓存 trace 上与 GDSF 基线对比验证。
Google DeepMind精选AI 评分Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Google ResearchAI 评分Google Research 提出 Sequential Attention:让 AI 模型更小更快且不牺牲精度
Google Research 提出 Sequential Attention,用贪心选择机制在单次训练中顺序、自适应地挑选最佳组件,把子集选择直接整合进模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,可用于特征选择、嵌入维度调优和权重剪枝,兼顾效率、精度、可解释性与可扩展性。
Google ResearchAI 评分Google 如何用简单 AI 模型预测电动车充电桩可用性
Google 设计了一个基于线性回归的轻量模型,预测某充电站在未来若干分钟后仍有空闲充电桩的概率,用于将充电站纳入 EV 导航路线以缓解续航焦虑。该模型仅以一天中的小时作为特征,在 30 至 60 分钟预测窗口、至少 6 个充电桩的站点上,表现优于"保持当前状态"这一强基线,主要靠识别高占用周转的少数关键时刻。
Google Research精选AI 评分Google 发布 Project Suncatcher 预印本,探索太空 AI 基础设施设计
Google 公布研究项目 Project Suncatcher,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,以在太空扩展 AI 算力。
推荐理由:Google 公开了太空 AI 基础设施的预印本,给出卫星互联、轨道与 TPU 抗辐射的实测数据,可了解这一设想的技术边界。
OpenAI NewsAI 评分 OpenAI 发布块稀疏 GPU 内核
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU 内核,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。团队已用这些内核在文本情感分析和文本、图像生成建模上取得 SOTA 结果。