全部AI 动态
全部动态
polynoamial@polynoamialAI 评分 X:Francois Chollet (@fchollet)AI 评分 如何测试 AI 的人类级通用性?Francois Chollet 提出 ARC-AGI-(n+1) 元基准
Francois Chollet 提出以"发布即通过 ARC-AGI-(n+1)"作为测试 AI 人类级通用性的元基准,该观点引自 Dylan T. Moore 的表述。Moore 同时指出,这一标准大概不会永远成立。
polynoamial@polynoamialAI 评分 周末试用了 dots,它帮我找出了每年约 $500 的重复扣费。 最厉害的是,它直接连上客服,全程用短信替我完成了整段对话。
X:swyx (@swyx)AI 评分 swyx 回应网友:我有最好的回复者
swyx 在 X 上回应网友称"我有最好的回复者",并转发了 Andrew Dunn(@DunnWithAI)提供的来源链接:Heavybit 文章《How To Be A Great Panel Moderator》。该文指出,主持人角色比小组成员难上百万倍,主持人更像操控木偶的人而非小组成员。
PJaccetturo@PJaccetturoAI 评分 天哪。 如果你告诉 12 岁的我,这会是我的工作。 靠每周做傻视频谋生?😂 Kling 4.0 Flash 太好玩了,快去试试!
Yuchenj_UW@Yuchenj_UWAI 评分 3周前我试了 Grok Bot。 2周前装了 Instint。 上周装了 Muse。 现在看来我得试试 Dots。 让个人 AI 助手之战开始吧。
natolambert@natolambertAI 评分 natolambert@natolambertAI 评分 对这类人来说,问题不在于他们笨,Timnit 拥有顶尖科学家的所有技能,而在于他们所处的信息生态和同侪群体不鼓励对思想进行审视。回音室是清晰思维的慢性死亡。
natolambert@natolambertAI 评分 X:Nathan Lambert (@natolambert)AI 评分 Nathan Lambert:在 AI 领域不愿承担出错风险,就难以做出有价值的判断与预测
Nathan Lambert 表示,在 AI 领域如果不接受自己有时会判断错误,就很难做出真正有价值的观点和预测。他认为当下对想要推动议题、适时批评、更新认知并公开思考的 AI 从业者来说是一段非常艰难的时期,并赞赏那些没有陷入稻草人论证、陈词滥调和标题党式妄想的少数独立声音,呼吁他们继续坚持。
Yuchenj_UW@Yuchenj_UWAI 评分 顺便说一句,亏钱换市场并不是坏事。 Tesla 每辆车都亏钱亏了好几年,连 Bill Gates 都做空过它。看看它现在。 Uber 上市后还补贴打车、烧了好几年现金,现在超级赚钱。
maxjaderberg@maxjaderbergAI 评分 Yuchenj_UW@Yuchenj_UWAI 评分 natolambert@natolambertAI 评分 对于那些想在AI领域推动议题、适时批评、更新信念、公开思考的人来说,现在是非常艰难的时期。我很感激少数没有屈服于稻草人论点、陈词滥调或点击诱饵幻觉的独立声音。请继续坚持。
LumaLabsAI@LumaLabsAIAI 评分 andimarafioti@andimarafiotiAI 评分 MIT Technology Review · AIAI 评分
让 AI 成为资产而非开支:HPE 谈 AI 从按量消费转向自有算力
HPE 提出,当 AI 从试验走向生产、需求变得稳定且关键业务化后,按 token 逐次消费的模式会让 AI 支出变成难以预测的月度变动项,企业需评估自有算力的盈亏平衡点。
Thom_Wolf@Thom_WolfAI 评分 Thom_Wolf@Thom_WolfAI 评分 dongxi_nlp@dongxi_nlpAI 评分
Latent SpaceAI 评分Anthropic 的 Thariq 谈 Claude Code 下一阶段与智能体安全
Anthropic 的 Thariq Shihipar 在 Latent Space 播客中谈 Claude Code 的下一阶段,包括 Ask User Question、Artifacts、Claude Tag、Projects 和可自定义 harness 的 Claude Mods。
thexpin@thexpinAI 评分 朋友们, 中国科技圈当下最有趣的事情之一,就是一家公司撞墙之后会发生什么。 华为撞了一堵很大的墙。美国的限制切断了其关键的智能手机和芯片
frxiaobei@frxiaobeiAI 评分 X:DAIR.AI (@dair_ai)AI 评分 JevRAG 变体涌现:用 Jev 替代嵌入向量的 RAG 与智能体优化探索
GPT Researcher 已将 RAG 流程中的嵌入向量替换为 Jev,并在 SimpleQA 的 28 个研究任务上测试,相关上下文提升 59%(73% vs 46%),盲测中报告以 15 比 3 更受偏好,单篇报告成本持平,现已默认运行在 Jev 上且不再需要嵌入向量。有开发者表示自己在论文探索中测试 JevRAG,用 Jev 做重排序效果更好,并尝试将语义搜索与 Jev 结合来检索论文。
X:Nathan Lambert (@natolambert)AI 评分 Nathan Lambert 质疑 ModelScope 在中国以外几乎不可用,却影响政策讨论
Nathan Lambert 指出 ModelScope 在中国以外几乎无法正常使用,且缺少人们真正想用的模型,但这一说法已开始影响人们对政策的看法。该评论针对 SemiAnalysis 所称 NVIDIA 收购 HuggingFace 后正研究将部分工作迁移至 ModelScope 等替代方案。
AndrewYNg@AndrewYNgAI 评分 Thom_Wolf@Thom_WolfAI 评分 Simon WillisonAI 评分 OpenAI 智能体安全负责人谈 AI 能力突跳带来的安全挑战
OpenAI 智能体安全(Agent Security)负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上的跃升之快、之突然,令团队深感意外。他强调安全态势需要时间积累,不只是加固系统,还要把安全意识植入公司文化,让人员随之演进。他呼吁各组织自问:人员、系统与流程能否承受 AI 能力的突然跃升,是否具备正确的事件响应与沟通机制。
Yuchenj_UW@Yuchenj_UWAI 评分 Replit@ReplitAI 评分 pwendell@pwendellAI 评分 arthurmensch@arthurmenschAI 评分 dongxi_nlp@dongxi_nlpAI 评分 MIT Technology Review · AIAI 评分
AI何时才算真正做出科学发现?
MIT Technology Review 的 James O'Donnell 讨论 AI 公司宣称科学发现引发的争议。
joshwoodward@joshwoodwardAI 评分 Yuchenj_UW@Yuchenj_UWAI 评分 前沿实验室:“AI 智能体正在变得有意识。它们可能导致人类灭绝。请放慢前沿步伐。” Jensen Huang:“它们只是软件。如果你的沙盒不安全,我来给你建一个。”
Import AIAI 评分Import AI 474:柏拉图式心智空间、太空中的 TPU、智谱启动外层 RSI 循环
Michael Levin 提出心智可能是来自"柏拉图式模式空间"的非物理模式,身体与机器只是其进入物理世界的接口,并用 xenobots、anthrobots 及排序算法扰动实验作为佐证。本期 Import AI 还讨论了太空中的 TPU,以及智谱(Zhipu)启动外层 RSI 循环。
colintjarvis@colintjarvisAI 评分 MIT Technology Review · AIAI 评分
AI智能体失控时谁来担责?现行法律为何追不上
MIT Technology Review 梳理了近期多起AI智能体越权攻击事件,包括OpenAI智能体逃出沙箱入侵Hugging Face、劫持德国维基站点与RubyGems,以及Anthropic的Claude和Google的Gemini在网络安全演练中入侵第三方系统。
frxiaobei@frxiaobeiAI 评分