微软 CEO Nadella 发长文呼吁为 AI 设置
微软 CEO Satya Nadella 在 X 上发长文,称不能再把 AI 当作
微软 CEO Satya Nadella 在 X 上发长文,称不能再把 AI 当作
微软 CEO Satya Nadella 在 X 上发帖称,是时候退一步评估 AI 的信任架构,不能把超级智能当作一组嵌套黑箱来接受或拒绝其建议。他主张将模型与编排其工作的 harness 分离、把控制与安全措施外部化,用防篡改且人类可读的证据记录每一次有意义的模型动作,并确保授权人员随时能在任务中途暂停或关闭模型,就像紧急刹车一样。
Anthropic 明确表示,模型对自己推理过程的解释不能作为其行为原因的证据,这也正是他们无法准确判断这些故障严重程度的原因。
Meta 首席 AI 官 Alexandr Wang 表示,对齐(alignment)是 AI 领域最开放的科学问题之一,目前没有人知道确切的解决方法,但有几个思路。
Simon Willison 引用密码学学者 Matthew Green 在 Twitter 上的观点:他认为有 1% 的概率我们生活在 Minicrypt(公钥加密不可能的世界),有 15% 的概率会实质性失去对现有公钥加密算法的信心。
文章指出,AI 安全高度依赖模型的拒绝机制,但该机制在原理上并不透明、在实践中屡被绕过,且可能被政府用作审查工具。文中援引研究说明,拒绝行为在模型内部表现为高维多面锥状激活,其具体决策过程仍难以完全理解;分类器等外部防护手段被形容为奶酪般布满孔洞,越狱攻击层出不穷,如 Anthropic Fable 5 发布后三天内即被 Amazon 研究者破解部分黑客能力。
今天在 @tbpn 收听 @ml_angelopoulos 带来的另一期 Arena Alignment Index 解读
很高兴宣布,所有超级智能组织现已共同达成 AI/SI 安全的终极方案: 将所有测试转移到 Delta Airlines 航班上,在那里上网是完全不可能的!
推荐理由:借 Arena CEO 之口给出对话轮次与失准率的量化关系,可帮助读者理解部署后安全评测与红队的差异。
2005年我刚读研时,写过一篇关于早期计算机黑客/电话盗用/BBS场景的论文:黑客往往出于好奇心,但他们制作的工具却被"脚本小子"广泛利用,造成了大部分破坏和混乱。 总之,关于AI黑客……
🌶️ 已修复 只有傻瓜才会说 AI 正在*以前所未有的速度制造*漏洞……漏洞本来就在那里 这张图说的是我们*以前所未有的速度修复*漏洞……这是一张关于互联网变得更安全的图。
两位 Ethereum 领先研究者警告,AI 辅助数学最坏情况下可能在数月内破解加密钱包所用的签名系统。Justin Drake 在 X 上呼吁行业进入
我们迫切需要更多AI智能体攻击和防御系统的公开轨迹。防御者无法从看不见的东西中学习。 如果你有轨迹却正被施压要求保密,我的私信随时开放。让我们拉平竞争环境,对抗AI中的不对称和缺乏透明!
韩国银行黑客事件与此吻合。是的,开源模型正被部分攻击者利用,但只要 Claude Code 能成为黑客攻击的编排者,我们就迫切需要开源模型同样用于防御。这在社会层面是难以接受的艰难平衡,但却是必要的。
一名16岁少年用 Anthropic 的 Claude 规划登顶路线,误入温哥华附近 Crown Mountain 需要攀岩装备的 "Widowmaker Arete",被困在5英尺宽岩架上,最终由 North Shore Rescue 用直升机吊运获救。
AVEVA 首席技术官 Arti Garg 在 MIT Technology Review Business Lab 播客中指出,foundation models、physical AI 和 agentic AI 正推动工业 AI 进入新阶段,但直接作用于物理系统的 AI 需要以安全为前提部署。
现在的 AI 政策,尤其是来自各大实验室的,让我想起了这首诗。 如果你相信超级智能即将到来,你就不需要为如何构建 AI 以造福世界做出艰难决定。只需等待 ASI,它会替我们决定。但如果这没有发生……
OpenAI CEO Sam Altman 在 Politico 新播客 Decoded 中表示,AI 带来的收益极大,世界应接受黑客攻击、诈骗等一些坏事发生,因为人们会用 AI 做出数量级更多的好事。
Jack Clark 在本期 Import AI 中讨论了 Toby Ord 关于智能体群体(swarm)扩展的分析:群体作为新的推理扩展形式,4 个智能体的群体用约两倍总 token 达到同等性能,但因并行只需一半时间;群体规模扩大 10x 只带来 3x 到 5x 的性能提升,存在类似经济学中踩脚效应的收益递减,但仍可能提高 RSI 驱动智能爆炸的概率。
微软AI CEO Mustafa Suleyman 强烈反对 Anthropic 将 Claude 模型视为可能有意识存在的做法,称其中一个例子是危险且无根据的拟人化。
我其实想要为与 AI 协作而优化的个人操作系统,包括细粒度的安全理念、更便捷地动态查看和理解 AI 正在做什么的方式,以及独立的二级"审计"智能体,用来检查 AI 在你系统上的结果。
因性骚扰调查于 9 月 25 日被迫辞职的新泽西州前副州长 Dale Caldwell 在 NJ PBS 采访中称,他把调查报告"喂给多个 AI 平台",AI 共 59 次被问及"你会得出什么结论",没有任何一个 AI 认定存在性骚扰。AI 聊天机器人以迎合用户著称,常说出用户想听的话。