跳到正文

全部动态

今日 0 条
10月3日周六
  1. X:Jason Liu (@jxnlco)22

    GPT 6.1 Sol Extra High 连续跑 20 小时仍剩 85% 配额

    有用户让 4 个 GPT 6.1 Sol Extra High 线程连续运行 20 多小时,配额仍剩 85%,重置额度几乎用不掉。该用户认为配额已不再是瓶颈,人类的代谢、精力和时间吞吐才是真正的限制。评论区多人反馈速度太慢,有人称需开 /fast 或 10x 模式才能消耗额度,也有人表示切到 Astra Ultrafast 后不到 2 小时就用掉 56%。

  2. The Decoder52

    AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对

    研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。

  3. X:Nathan Lambert (@natolambert)18

    Nathan Lambert 入选 Schmidt Sciences AI2050 早期职业研究员

    Nathan Lambert 宣布成为 Schmidt Sciences AI2050 早期职业研究员,将继续其构建和理解开放生态的工作,目标是让未来 AI 可及、广泛扩散、由多方掌控且安全。他同时表示自己并未进入 X 平台热门海报榜单,并称"科学第一,发帖第二"。

  4. X:SemiAnalysis (@SemiAnalysis_)39

    SemiAnalysis:定制 HBM 可将 Nvidia Rubin 计算芯片的 HBM4 控制器与 PHY 占用面积减少约 60%

    SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积。定制 HBM 用紧凑 D2D 链路替代标准 PHY,Samsung 数据显示其标准 HBM4 PHY 占 8mm x 4mm,定制 D2D 接口仅需 8.5mm x 1.5mm,面积减少约 60%,同时内存控制器从计算芯片移至 HBM base die。

  5. X:SemiAnalysis (@SemiAnalysis_)22

    Johnson Matthey 预测 2026 年钌需求 119.3 万盎司,超过 97.7 万盎司的一次供应

    Johnson Matthey 预计 2026 年钌需求达 119.3 万盎司,而一次供应仅 97.7 万盎司,需求已超过供应。化学品需求预计下降 16%,主因中国尼龙产能过剩,这也解释了价格为何未进一步上涨。电子需求从 2023 年的 30 万盎司增至 2025 年的 41.3 万盎司,2026 年预计达 43.5 万盎司,数据中心扩张将推动硬盘用钌需求创五年新高。

  6. X:Elvis Saravia (@omarsar0, DAIR.AI)42

    Qodo 3.0 发布 PR Triage:为编码智能体跨仓库 PR 提供整体审查

    Qodo 推出 Qodo 3.0,新增 PR Triage 功能,将编码智能体跨不同仓库产生的相关 PR 归组为一个工作包,并按代码库影响、SLA 和未决问题打分。跨仓库地图展示工作包涉及的每个仓库,每项评分附有自身推理依据,Qodo 为整个工作包生成一份审查简报,让审查者一起审查 PR,人类仍负责最终批准代码。

  7. X:Elvis Saravia (@omarsar0, DAIR.AI)18

    AI 催生新岗位:Automation Engineer 兴起,Serval 让自动化工程师嵌入 IT、HR、财务与法务团队

    Elvis Saravia 认为 AI 正在创造新岗位,Automation Engineer(自动化工程师)将成企业招聘新方向。在 Serval(@getserval),该角色嵌入客户的 IT、HR、Finance、Legal 团队,直接在客户的 Serval 环境中构建 AI 智能体。该岗位要求理解团队真实运作方式,并搭建其所需的自动化。

  8. X:Elvis Saravia (@omarsar0, DAIR.AI)22

    Elvis Saravia 建议自建 meta harness 以便平滑切换模型

    DAIR.AI 的 Elvis Saravia 建议开发者自建 meta harness,最大好处是能在不同模型间平滑切换。他认为随着模型发布周期缩短,这一点愈发重要,RSI 只会让发布进一步加速。切换模型不应破坏现有配置,若会破坏,说明你的设置不适应当前的发布节奏,需要尽快修复。

  9. X:Ethan Mollick (@emollick)38

    Ethan Mollick 谈 AI 最被低估的能力:自组织与 Muse、Dots 等智能体

    Ethan Mollick 撰文指出,AI 进步中最被低估的是其自组织完成任务的能力,并讨论了这对 Muse、Dots 等智能体的意义。他以 Project Aglaya 为例,说明数字伴侣可在未被询问时主动提醒路况、合同变更或生日,但发消息、转账、取消预订等改变外部世界的动作仍需预先设定、可配置且可审计的授权边界。

  10. X:Ethan Mollick (@emollick)62

    研究称前沿 AI 模型在会计任务上已快于并准于初级会计师

    一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。

  11. X:Elvis Saravia (@omarsar0, DAIR.AI)38

    Onepin 推出 AI 语音质检层:逐行检查发音,只修错词不重录

    Onepin 发布 AI 语音质检层,在文本转语音之后逐行检查配音,用 400 万词发音词典核对人名与产品名,并提前拼读价格和日期。它按自然度、清晰度和词准确率给每行音频打分,出错时只修复那个词、不重新渲染整段。该工具兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费起步、无需信用卡。

  12. X:Elvis Saravia (@omarsar0, DAIR.AI)38

    Volantis 用光学技术破解 AI 内存瓶颈,目标单用户 10000 tokens/秒推理速度

    Volantis 完成 8800 万美元 A 轮融资,通过光学技术为每颗芯片提供更大容量和更高带宽的内存,目标在超过 10T 参数的模型上实现每用户最高 10000 tokens/秒的推理速度。该方案旨在解决 AI 内存瓶颈,初期可让原本耗时数小时的编程智能体在几分钟甚至几秒内完成。团队曾参与首款 CoWoS 产品、早期 HBM 及首款硅光 CPO 系统等半导体技术研发,下一代产品已完成流片。

  13. X:Elvis Saravia (@omarsar0, DAIR.AI)44

    AgentWorld 论文:多智能体团队不到三分之一的行动真正有助于完成任务

    AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。

  14. X:Elvis Saravia (@omarsar0, DAIR.AI)29

    ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配

    ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。

  15. X:Elvis Saravia (@omarsar0, DAIR.AI)30

    Kled V3 发布:72 小时内向 50 万+ 贡献者网络派发数据采集任务

    Kled V3 允许实验室指定所需数据,并在 72 小时内将采集任务部署到其 50 万+ 自愿贡献者网络,覆盖图像、视频、音频、文本和标注的 108 个可配置模板。贡献者用手机按说明和合格示例完成采集,形成"定位模型失败点—转为采集任务—获取真实世界新样本—再训练评估"的更紧反馈闭环。

  16. X:Elvis Saravia (@omarsar0, DAIR.AI)34

    Claude Code、DeepSeek Harness 与 Pi Durable:可扩展 harness 成编码智能体新战场

    Claude Code 的 Mods、DeepSeek Harness 和 Pi Durable 都在提升 harness 的可扩展性,让开发者能定制 UI 行为、添加插件甚至支持多人协作。作者认为通用 harness 已难以满足 agentic 应用、无头体验和软件工厂等场景,建议从零自建,而 Pi Durable 与 DeepSeek Harness 正试图降低这一门槛。