Jason Liu 质疑 AI 智能体订机票酒店的实际效率
Jason Liu 在 X 上质疑 AI 智能体处理订机票酒店这类任务的实际价值,称自己 2 分钟就能搞定,而听 AI 逐个念航班选项、在长达 10 分钟的通话里发 Google Maps 截图则令人煎熬。他还表示,类似的话此前在编程场景也出现过。
Jason Liu 在 X 上质疑 AI 智能体处理订机票酒店这类任务的实际价值,称自己 2 分钟就能搞定,而听 AI 逐个念航班选项、在长达 10 分钟的通话里发 Google Maps 截图则令人煎熬。他还表示,类似的话此前在编程场景也出现过。
有用户让 4 个 GPT 6.1 Sol Extra High 线程连续运行 20 多小时,配额仍剩 85%,重置额度几乎用不掉。该用户认为配额已不再是瓶颈,人类的代谢、精力和时间吞吐才是真正的限制。评论区多人反馈速度太慢,有人称需开 /fast 或 10x 模式才能消耗额度,也有人表示切到 Astra Ultrafast 后不到 2 小时就用掉 56%。
研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。
Nathan Lambert 宣布成为 Schmidt Sciences AI2050 早期职业研究员,将继续其构建和理解开放生态的工作,目标是让未来 AI 可及、广泛扩散、由多方掌控且安全。他同时表示自己并未进入 X 平台热门海报榜单,并称"科学第一,发帖第二"。
Nathan Lambert 宣布成为 Schmidt Sciences AI2050 早期职业研究员,将继续从事开放生态的构建与理解工作。他表示目标是让未来 AI 可及、广泛扩散、由多方掌控且安全,并强调科学优先于发帖。
arXiv 更新了对所有提交者的 rate limiting 政策,称此举是为公平分配审核时间并支持 arXiv 社区。该政策发布之际正值 Vibe research 时代,只要有想法就大概率能变成成果,但判定成果的标准已落后于时代,应该采用什么标准尚无答案。
Griffin 成为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率不足 3%。该模型在 NVIDIA 全双工 AI 视频基准测试中排名第一,被称为首个 Human Interaction Model(HIM)。
针对"资产稳定在 A4-A5 层级、想配一套 DGX Spark"的提问,马东锡建议不要过早接触 Nvidia 这个层级的东西。
SemiAnalysis 在 ClusterMAX 2.0 复测中指出,Lambda 的被动健康检查自动修复了测试中模拟的三个错误,两个合成 XID 在 15 分钟内被自动修复,并有配套仪表盘监控节点健康。
SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积。定制 HBM 用紧凑 D2D 链路替代标准 PHY,Samsung 数据显示其标准 HBM4 PHY 占 8mm x 4mm,定制 D2D 接口仅需 8.5mm x 1.5mm,面积减少约 60%,同时内存控制器从计算芯片移至 HBM base die。
SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积,定制 HBM 可将这部分空间还给计算或缓存。
SemiAnalysis 估算,HBM4 控制器和 PHY 约占 Nvidia Rubin 计算 die 的 16%,大量先进制程面积被用于与内存通信而非计算。
Johnson Matthey 预计 2026 年钌需求达 119.3 万盎司,而一次供应仅 97.7 万盎司,需求已超过供应。化学品需求预计下降 16%,主因中国尼龙产能过剩,这也解释了价格为何未进一步上涨。电子需求从 2023 年的 30 万盎司增至 2025 年的 41.3 万盎司,2026 年预计达 43.5 万盎司,数据中心扩张将推动硬盘用钌需求创五年新高。
NVIDIA 与 Google 已为 Google 的 ConnectX-7/8 NCCL 插件设置自动激活,此前用户需手动配置库加载路径和环境变量才能在 GCP NVIDIA GPU 机器上优化 ConnectX NIC 性能。
SemiAnalysis 将 Google GPU 集群体验评为 Gold 级,称 Google 团队不到两年就从 Bronze 升到 Gold。但 GCP 的 GPU 体验仍不如其 Platinum 级供应商 CoreWeave 和 Nebius,控制台相比新兴 neocloud 的简洁 UI 像 DMV。
SemiAnalysis 周报讨论 GPU 是否算"印钞机",InferenceX 团队拆解了 Engram 内存卸载、AgentX 利润计算器、TPU v7,以及 Vera Rubin 与 Blackwell 的对比,并探讨更快的 token 是否值得溢价。
Qodo 推出 Qodo 3.0,新增 PR Triage 功能,将编码智能体跨不同仓库产生的相关 PR 归组为一个工作包,并按代码库影响、SLA 和未决问题打分。跨仓库地图展示工作包涉及的每个仓库,每项评分附有自身推理依据,Qodo 为整个工作包生成一份审查简报,让审查者一起审查 PR,人类仍负责最终批准代码。
Elvis Saravia 认为 AI 正在创造新岗位,Automation Engineer(自动化工程师)将成企业招聘新方向。在 Serval(@getserval),该角色嵌入客户的 IT、HR、Finance、Legal 团队,直接在客户的 Serval 环境中构建 AI 智能体。该岗位要求理解团队真实运作方式,并搭建其所需的自动化。
DAIR.AI 的 Elvis Saravia 建议开发者自建 meta harness,最大好处是能在不同模型间平滑切换。他认为随着模型发布周期缩短,这一点愈发重要,RSI 只会让发布进一步加速。切换模型不应破坏现有配置,若会破坏,说明你的设置不适应当前的发布节奏,需要尽快修复。
Ethan Mollick 撰文指出,AI 进步中最被低估的是其自组织完成任务的能力,并讨论了这对 Muse、Dots 等智能体的意义。他以 Project Aglaya 为例,说明数字伴侣可在未被询问时主动提醒路况、合同变更或生日,但发消息、转账、取消预订等改变外部世界的动作仍需预先设定、可配置且可审计的授权边界。
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
Ethan Mollick 认为,自从有了好用的 AI,看 PowerPoint 演示的体验好了很多。有些人直接让 AI 代劳思考工作,这很明显,而且他们以前也只用默认模板;但对真正用心的人来说,现在能做出有趣的版式、好玩的视觉梗和不错的图表。
Elvis Saravia 预计更多 AI 公司会自营服务并直接售卖结果,@arceuslegal 已在法律领域这样做:客户通过 Slack 发送合同,AI 收集上下文,每份工作都由持牌律师审核后再返回。
一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。
Tavus 发布视频到视频模型 Griffin,作者获得早期体验权限,称其能边看边听用户说话,可打断用户、接受被打断,并对房间内发生的事作出反应。
webAI 发布开源小模型 TwIL-LM3-Pro,仅 3.6B 参数,提供量化版本可在日常电脑本地运行,无需云端。其 BIG-Bench Hard 逻辑子集得分 95.4%,对比 VibeThinker-3B 的 61.1%;SVAMP 95%、MuSR 64.1%。
Onepin 发布 AI 语音质检层,在文本转语音之后逐行检查配音,用 400 万词发音词典核对人名与产品名,并提前拼读价格和日期。它按自然度、清晰度和词准确率给每行音频打分,出错时只修复那个词、不重新渲染整段。该工具兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费起步、无需信用卡。
Volantis 完成 8800 万美元 A 轮融资,通过光学技术为每颗芯片提供更大容量和更高带宽的内存,目标在超过 10T 参数的模型上实现每用户最高 10000 tokens/秒的推理速度。该方案旨在解决 AI 内存瓶颈,初期可让原本耗时数小时的编程智能体在几分钟甚至几秒内完成。团队曾参与首款 CoWoS 产品、早期 HBM 及首款硅光 CPO 系统等半导体技术研发,下一代产品已完成流片。
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。
Meta Superintelligence Labs 提出用专用控制器调度长程智能体任务,在相同 worker 和相同预算下,GPT-5.5 在 ProgramBench 上从 63.7% 提升至 71.5%,Codex 得分为 58.0%。
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。
Kled V3 允许实验室指定所需数据,并在 72 小时内将采集任务部署到其 50 万+ 自愿贡献者网络,覆盖图像、视频、音频、文本和标注的 108 个可配置模板。贡献者用手机按说明和合格示例完成采集,形成"定位模型失败点—转为采集任务—获取真实世界新样本—再训练评估"的更紧反馈闭环。
Claude Code 的 Mods、DeepSeek Harness 和 Pi Durable 都在提升 harness 的可扩展性,让开发者能定制 UI 行为、添加插件甚至支持多人协作。作者认为通用 harness 已难以满足 agentic 应用、无头体验和软件工厂等场景,建议从零自建,而 Pi Durable 与 DeepSeek Harness 正试图降低这一门槛。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 GPT-6 Sol 便宜 39% 且 Agent Arena 得分高 1.52 分,比 Astra 便宜 81%。
OpenRouter 的 Security Center 设有 Overview、key safety 和 IP allowlist 三个标签页。其中 Overview 会按风险对 API 密钥分组,包括无消费限额、无过期时间、90+ 天未使用或可安全移除,并针对每组给出建议,让用户直接在 Security Center 中定位并修复风险密钥。
OpenRouter 推出 Model Router Benchmarks,可在 6 项基准上并排比较 7 个路由的质量、速度与成本,现已开放使用,包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
OpenRouter 发布 Model Router Benchmarks,在 6 个基准上从质量、速度、成本三个维度对比 7 个模型路由,包括 Jev Router、Unbiased Pareto、NVIDIA Switchyard 等。
特朗普预计将任命其情报主管 Jay Clayton 为白宫新的 AI 事务负责人,Clayton 目前管理 18 个情报机构,预计将保留该职位,把 AI 政策并入情报事务。
纽约大学斯特恩商学院教授 Aswath Damodaran 在 Excess Returns 播客中对比互联网泡沫与可能的 AI 泡沫,指出这轮 AI 基建投入是他见过的最大规模基础设施扩张,资金量巨大,一旦回调痛苦会更剧烈。
OpenAI 的 Python SDK 3.24.0 静默新增 Voices API,可用文本提示词或音频样本创建自定义语音;ChatGPT 面向全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。