uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署生产
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 做监督微调,并叠加提示词级输出优化,使其适配自身零售审核策略。
一种新的在线策略蒸馏方法通过外推 RL 引发的表征残差,让学生在四组模型对上匹配甚至超越教师模型。该方法将教师视为方向而非终点,代码和 checkpoint 计划发布。
Volantis 宣布完成 8800 万美元 A 轮融资,用光学技术解决 AI 内存瓶颈,将单芯片内存带宽与容量提升数个数量级,实现大模型(>10T)最高 10,000 tps/user 的超快推理和低 $/tok。该方案初期面向编程智能体,把原本数小时的任务压缩到几分钟甚至几秒,其下一代产品已完成流片,目标刷新相关距离上的带宽密度世界纪录。
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间同行贡献了 AI 公司投资额的 55.2%,AI 投资者自身交易额的 28.7% 流向 AI 标的。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间 AI 企业获得的投资中 55.2% 来自其他 AI 公司,而 AI 投资方投出的资金中只有 28.7% 流向 AI 企业。
Volantis 完成 8800 万美元 A 轮融资,由 Lachy Groom 和 Abstract 联合领投,John Doerr、Susa Ventures、VXI Capital、Triatomic Capital 参投,Jeff Dean、Dwarkesh Patel、Naveen Rao、Sholto Douglas 以天使身份加入。
Volantis 完成 8800 万美元 A 轮融资,由 Lachy Groom 和 Abstract 联合领投,John Doerr、Susa Ventures、VXI Capital 和 Triatomic Capital 参投。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
Google 的轨道计算卫星搭乘 SpaceX 火箭从加州升空,首次将其 TPU 送入太空,用于验证芯片在轨供电、散热与运行模型的能力。
Arena 发布文生图模型后训练研究,认为人类偏好奖励必要但不充分,偏好模型仍会奖励细节缺失、加入未要求内容等 reward-hacking 输出。
Arena 研究提出前沿图像模型后训练的复合奖励方案,认为人类偏好奖励必要但不充分,偏好模型仍可能奖励细节缺失、引入未请求内容等 reward-hacking 行为。
SemiAnalysis 分析称,定制 HBM 可将内存控制器从 XPU 移到 HBM base die,并用 Nvidia 的 NV-HBI die-to-die 链路替代标准 PHY。
SemiAnalysis 估算,Rubin 上 HBM 控制器与 PHY 约占 GPU 裸片 16%,采用 NVHBM 的 Feynman 将降至约 4%,因为内存控制器从 XPU 移至 HBM base die,标准 PHY 被 Nvidia 紧凑的 NV-HBI die-to-die 链路取代。
Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。
国际清算银行(BIS)发布报告,分析 AI 公司之间的循环融资。2021 至 2025 年间,同行贡献了 AI 公司投资金额的 55.2%,AI 投资方 28.7% 的交易金额流向 AI 标的。
Meta 研究博客发布《Solving Open Research Problems Together》,介绍数学家与 Muse Spark 合作完成六篇研究论文。该内容为 AI at Meta 转推并附上研究博客链接。
Meta 团队借助 Muse Spark 在非结合代数中找到了一个反例,推翻了受生物学启发提出的数学结构规则。他们进一步给出替代刻画,并由研究人员核验与完善。相关论文已发布在 Meta 研究页面。
美国司法部逮捕Earthmade Computer CEO Greg Lui,指控其用虚假文件将价值超3亿美元的Nvidia A100、H100 GPU服务器走私至中国,涉及马来西亚、新加坡等中转地,走私活动从2023年10月持续至2026年8月。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
Trillium Labs 今日亮相,是一家推动前沿 AI 开放科学的新非营利组织,将构建开放的后训练配方,并扩展至开放基础设施,研究 RSI、奖励黑客与多智能体系统。该组织由 Nathan Lambert 与 Tom Zick 共同创立,已获 Halcyon Futures 和 Schmidt Sciences 初始支持,正在招聘全职与学生合作者并筹集算力。
Trillium Labs 作为一家新非营利组织正式亮相,致力于推动前沿 AI 的开放科学,将构建开放的后训练配方并扩展至开放基础设施,研究 RSI、reward-hacking 和多智能体系统。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
在 Amazon SageMaker AI 上可用多轮强化学习(MTRL)微调搜索智能体,官方示例以 Qwen3.6-27B 为基础模型,在 us-west-2 区域训练,智能体配备 BM25 词法搜索与向量搜索两个工具。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
Airbnb CTO Ahmad Al-Dahle 向 Latent Space 介绍了公司的 AI 原生改造:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并发布 SETA-Env 数据集,包含 4500+ 个开源可验证终端 RL 环境及完整的合成与训练管线。
Ramp 经济学家 Ara Kharazian 发布的 Ramp AI Index 显示,美国企业 AI 支出自 7 月见顶后持续下降,而使用量自 7 月以来上升约 50%,并在 9 月底创下新高。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。
ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。
Amazon Quick 为 AI 构建的应用推出 Live Data in Apps,可在用户每次打开应用时实时查询受治理的 Quick Sight 数据集,取代发布时固化的静态快照。该功能支持 SPICE 与 Direct Query 两种数据集模式,查询以查看者身份执行,自动沿用既有行级与列级安全规则,查看者需为已认证的 Quick 用户并首次按数据集授权。
PostTrainBench v1.2 发布,新增云 GPU 支持,可通过 Harbor adapter 在 Harbor + Modal 上以相同设置运行基准测试。
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义 memory provider 将 Amazon S3 Vectors 用作持久记忆层,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周线上 A/B 测试中,一个人群的最终漏斗转化率相对提升达高个位数百分比,另一个人群则未见改善,问题出在内容而非模型。
LongLive-Plug 提出一种面向视频生成的一次性(one-step)通用蒸馏方法,可让长时长视频生成更易部署,并为需要快速出片的创作者节省算力与时间。该方法无需多次迭代即可完成蒸馏。