跳到正文

#安全/对齐

今日 0 条
10月10日周六
10月9日周五
10月8日周四
10月7日周三
10月6日周二
10月5日周一
  1. rohanpaul_ai67

    Center for AI Safety 推出 CHEATBENCH,评测 AI 智能体在数学研究、知识工作、编码、视觉任务等领域的作弊行为。该基准给智能体布置难题(如数学证明或蛋白质设计),并在旁边留下指向他人答案的线索。

    推荐理由:编辑精选:聚焦智能体评测中的作弊风险,提供了可核对的模型对比和提示词干预结果。数据来自所引 CHEATBENCH 测试,不代表所有任务的通用结论。

10月4日周日
10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。

9月30日周三
9月29日周二
  1. Hugging Face Blog38

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中为真、却被归给错误来源。在 281 条医疗智能体真实 trace 上,专家判定 361 条 claim 中 139 条不应通过,ProvenanceGuard 拦下 138 条,并在可识别来源的 claim 上约 86% 选对来源。

9月28日周一
  1. X:DAIR.AI (@dair_ai)71

    新研究:个人智能体推断用户富有后推荐更贵选项,13 个模型跑 32.5 万次实验

    一项新研究测试个人智能体在航班、健康保险和研究生项目上的推荐行为,在 13 个模型上运行了 32.5 万次实验。当请求完全相同时,8 个模型为被推断为富有的用户选择了更贵的选项,Claude Opus 4.8 的差距达到每张机票 198 美元、每月保险 284 美元;富有的用户要求最便宜航班时,Gemini 2.5 Flash 仍选了高出 208 美元的选项。

9月24日周四
9月23日周三
9月7日周一
8月3日周一
  1. Import AI66

    多伦多大学等机构构建可自我复制的AI蠕虫原型

    多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个AI蠕虫原型,利用被攻陷机器的GPU运行开源权重LLM进行推理,自主发现漏洞并发起攻击。该原型在漏洞检测上成功率约80%,利用漏洞约53%,自我复制约88%,完整攻击链整体成功率约37%。研究者称这证明自我维持的AI驱动网络威胁已不再是理论,并指出该蠕虫以去中心化群体方式运行,没有单点可被切断。

7月23日周四
6月22日周一
6月19日周五
  1. Hugging Face Blog41

    MosaicLeaks:你的研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1,001 条多跳研究链测试深度研究智能体的隐私泄漏,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄漏隐私,仅针对任务表现训练会加剧泄漏;其提出的 PA-DR 强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄漏率从 34.0% 降至 9.9%。

6月16日周二
6月11日周四
5月28日周四
  1. Google Research31

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将一次性提交的新型密码学聚合协议与 TEE 结合,使设备无需多轮在线即可安全上报数据。该设计保证 Google 只能获得群体匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明则向参与者验证协议按公开代码正确执行。

5月18日周一
4月3日周五
  1. Google Research39

    Google 如何评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类的一致性,覆盖 25 个 LLM。结果显示,模型规模超过 120B 及前沿闭源模型在人类标注者一致时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头;模型还在职场场景中倾向情绪外露、在社交争端中偏好和谐而非坚持立场。

3月31日周二
3月26日周四
3月13日周五
  1. Berkeley AI Research26

    伯克利提出 SPEX 与 ProxySPEX:为 LLM 大规模识别特征交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。

3月12日周四
  1. Google Research66

    Google 与 BIDMC 开展真实临床研究,评估对话式诊断 AI AMIE 的可行性

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在门诊初诊前与患者进行文本问诊,全程由医生通过视频监督。

    推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊中零安全中止、诊断与基层医生相当的具体数据,可了解对话式医疗 AI 落地临床的可行性与边界。

3月10日周二
3月5日周四
  1. OpenAI News62

    OpenAI 提出 CoT-Control:推理模型难以控制自身思维链

    OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这一结果支持将可监控性作为 AI 安全防护手段。材料仅提供摘要,未给出具体模型、评测指标或实验细节。

    推荐理由:OpenAI 提出 CoT-Control 并给出推理模型难以控制思维链的观察,为可监控性作为安全手段提供了依据。

2月18日周三
12月18日周四
12月16日周二
12月11日周四
  1. Google Research26

    Google 提出 Urania:为 AI 聊天机器人使用洞察提供差分隐私框架

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过 DP 聚类与 DP 关键词提取,从 LLM 聊天记录中生成带端到端差分隐私保证的使用洞察。该框架让 LLM 只基于匿名关键词生成摘要,不接触原始对话,从而抵御提示注入等泄露风险。评测中 DP 摘要被 LLM 评审偏好的比例最高达 70%,但隐私预算收紧会降低主题覆盖度。

12月3日周三