全部AI 动态
全部动态
drfeifei@drfeifeiAI 评分 dsp_@dsp_AI 评分
Latent SpaceAI 评分Latent Space 对话 John Platt:Google ERA 如何用 Gemini 自动求解可评分科学问题
Google 的 Empirical Research Assistance(ERA)把可写成评分函数的科学问题交给 Gemini 自动求解:它维护一棵实验 notebook 树。
hq4ai@hq4aiAI 评分 ericzakariasson@ericzakariassonAI 评分 我还记得大约 1.5 年前我们构建这个的第一个简陋版本,只是为了应对疯狂的流量。 那时学到的经验至今仍然成立:先爬,再走,再跑。找到持续改进的飞轮。让它持续运行(这适用于很多事情) 团队干得漂亮!
sama@samaAI 评分 sama@samaAI 评分 michelle是体现这一点的最佳代表之一 openai非常非常幸运,能从她迄今为止所做的一切中受益,我认为人们看到她和团队接下来酝酿的东西会相当满意!
sama@samaAI 评分 sama@samaAI 评分 sama@samaAI 评分 我们希望 OpenAI API 在每个价位都有最好的模型,并在每种模态(文本、代码、图像、视频等)上都做到最好。 然后我们希望你们都能想出好点子并构建出来,成为快乐的用户。最好的点子将来自你们。
Simon WillisonAI 评分 @therealcornpop 谈 AI 写脚本为何一眼可辨
TikTok 创作者 @therealcornpop 指出,用 AI 写 TikTok 和 YouTube 脚本很容易被识破,原因不只是"不是 X,而是 Y"这类 AI 腔、三段式结构或断句怪异的文风,更在于内容里缺少任何明确立场,读者能看出你对所谈之事没有自己的观点。
elonmusk@elonmuskAI 评分 hq4ai@hq4aiAI 评分 这次上海演唱会的终曲。 一年前,这首SURREAL把YURI带到世界上。 一年后,AI技术已经可以在100米的巨幕上呈现这种级别的声光效果,而一切只是刚刚开始。
MIT Technology Review · AIAI 评分
别被这个夏天的 AI 炒作忽悠了
针对 Anthropic 称 Claude Mythos 找漏洞强于安全专家、OpenAI 与 Hugging Face 遭黑客攻击、以及两家公司相继宣称数学突破等一系列事件,专家核查后认为这些说法被夸大:黑客事件更源于 OpenAI 安全疏忽,数学成果也被指"不如初看时新颖",并遭研究不端与抄袭指控。文章呼吁政策制定者听取独立专家意见,而非依赖企业新闻稿。
arthurmensch@arthurmenschAI 评分 OpenBMB@OpenBMBAI 评分
Latent SpaceAI 评分TypeSafe CEO Diogo Almeida 谈 Jev:为生产环境打造 System One 模型
TypeSafe AI CEO Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,称其为面向代码消费的 System One 大模型,按每美元智能优化,发布视频播放量约 4000 万次。
OfficialLoganK@OfficialLoganKAI 评分 如果你在用 AI 构建产品,你应该花超过 25% 的时间来制作评测基准,并设法让模型实验室重视这些基准 这是加速公司进展最简单的路径
AndrewYNg@AndrewYNgAI 评分 JeffDean@JeffDeanAI 评分
NVIDIA BlogAI 评分
AI 安全是工程问题:如何在智能体栈的每一层解决它
NVIDIA 提出 AI 安全应作为工程问题处理,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体之外强制执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描和验证智能体技能。
Import AIAI 评分Import AI 473:美国超级智能战略、人脑组织小鼠与机器诠释学
RAND 发布报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、构建 AI 安全架构、改造国家安全体系等方式保留所有选项。报告还梳理了共存、拒止、加速三大类共七种原型战略,并列出危险临近程度、共存可行性、约束可行性等五项主要不确定性。
Hailuo_AI@Hailuo_AIAI 评分 OfficialLoganK@OfficialLoganKAI 评分 ericzakariasson@ericzakariassonAI 评分 GenAI_is_real@GenAI_is_realAI 评分 GenAI_is_real@GenAI_is_realAI 评分 我们希望构建一个推理框架,其优化在生效时和因条件变化而失效时都能得到解释。这也是我希望我们更多人在 SGLang Omni 中共同承担的工程实践。
Simon WillisonAI 评分 工程师称所在大公司规格、代码与测试全部由 Claude Code 生成
一位工程师称自己入职某大公司半个月,发现这里的规格、代码、测试、PRD、工单及其处理、报告等全部由 Claude Code 生成,团队里没人喜欢这种方式,只是被迫尽可能多地交付。管理层多次表示推代码不是瓶颈,质疑为何进度慢,而人们每天工作 12 到 13 个小时只是为了按回车,从 L1 到 L7 的工程师都在做同样的事,没有人阅读任何内容。
hq4ai@hq4aiAI 评分 汗青HQ发文感慨AI行业舆论焦点始终追逐短期热点,鲜有媒体报道那些慢慢打磨的产品。他指出长期主义最大的挑战在于缺乏反馈时仍要坚持,而其优点是"不挤"。
hq4ai@hq4aiAI 评分 ericzakariasson@ericzakariassonAI 评分 ericzakariasson@ericzakariassonAI 评分 Eric Zakariasson 发布了一首以 Grok Bot 为主题的说唱歌词,将 Grok Bot 描绘成能接管任务、编写代码的 AI 智能体。
polynoamial@polynoamialAI 评分
drfeifei@drfeifeiAI 评分 Agents 可以是 AI,但能动性(agency)属于人类。借助工具,赋能自身的能动性是每个人的责任。但北极星应始终以人为中心。
GitHub Blog · AI & MLAI 评分GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 已死、Skills 杀死 MCP?
GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。
RenLeanna@RenLeannaAI 评分 InfobipShift@InfobipShiftAI 评分 joshwoodward@joshwoodwardAI 评分 polynoamial@polynoamialAI 评分
simpsoka@simpsokaAI 评分