全部AI 动态
全部动态
arena@arenaAI 评分 karinanguyen@karinanguyenAI 评分 Gemini 4 在 PostTrainBench 上达到 45.3%,是 Gemini 3.1 Pro 21.99% 的两倍多,并超过 GPT-6 Astra 🔥
joshwoodward@joshwoodwardAI 评分 arena@arenaAI 评分 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第一,在 Code Arena: WebDev 以 1679 分排名第八。
aipulseda1ly@aipulseda1lyAI 评分 ArtificialAnlys@ArtificialAnlys精选AI 评分 推荐理由:原文给出智能指数、成本和幻觉率的横向对比,读者可据此判断新模型相对竞品的性价比位置。
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 ARC Prize 指出 GPT-6.1 Sol 与 GPT-6 Astra 类似,在 ARC-AGI-3 上推理等级越高决策越好,完成关卡所需动作越少,从而降低总推理成本。
Ars Technica · AIAI 评分Google 发布 Gemini 4 Argon 模型,暂未对外开放使用
Google 发布 Gemini 4 Argon 模型,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部有限测试,外部用户尚不能使用。
andonlabs@andonlabsAI 评分 X:Ethan Mollick (@emollick)AI 评分 Gemini 4 Argon 发布,先向网络防御方开放
Gemini 4 Argon 作为新的前沿模型发布,从今天起先向网络防御方(cyber defenders)开放,之后会尽快扩大范围。介绍价定为输入 $2、输出 $10。发布者称竞争再次回到三方格局。
OfficialLoganK@OfficialLoganKAI 评分 Google 内部众多同事为打造这个模型付出了大量工作,看到这里的进展令人惊叹,而这仅仅是个开始!迫不及待想让更多人用上 Gemini 4 Argon。
ammaar@ammaarAI 评分 GoogleAI@GoogleAI精选AI 评分 推荐理由:原文说明了该模型面向的三类复杂工作流场景和输出上限,读者可据此判断它对长任务工作流的适配程度。
ValsAI@ValsAIAI 评分 Gemini 首次登上 Vals Index 榜首。 Gemini 4 Argon 以 68.9% 占据 Vals Index 第 1 名。
Google@Google精选AI 评分 Google 宣布 Gemini 4 Argon 是其前沿智能的下一个时代,在多项基准测试上取得显著提升,并在真实世界的长程软件工程任务上树立了新的 state of the art。
Google@GoogleAI 评分 Google@Google精选AI 评分 Google 宣布推出 Gemini 4 Argon,称其在复杂工作流中具备前沿性能,覆盖真实世界的软件工程、知识工作和网络安全防御,并拥有业界领先的 1M token 输出上限。
GoogleDeepMind@GoogleDeepMindAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 OfficialLoganK@OfficialLoganKAI 评分 Google 发布新前沿模型 Gemini 4 Argon,即日起向网络安全防御者(cyber defenders)开放,并将尽快更广泛推出。Argon 介绍期定价为输入 $2、输出 $10。
sundarpichai@sundarpichaiAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
turbopuffer@turbopufferAI 评分 AravSrinivas@AravSrinivasAI 评分 perplexity_ai@perplexity_aiAI 评分 在 Hugging Face 上查看 pplx-embed-v2-context-9b-preview: huggingface.co/perplexity-ai…
perplexity_ai@perplexity_aiAI 评分 perplexity_ai@perplexity_aiAI 评分 Davidstout@DavidstoutAI 评分 runwayml@runwaymlAI 评分 MiniMax_AI@MiniMax_AIAI 评分 runwayml@runwaymlAI 评分 AntLingAGI@AntLingAGI精选AI 评分 推荐理由:原文给出了参数规模、上下文长度和三项评测分数,读者可据此判断其定位与开源计划。
Google DeepMind精选AI 评分Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时保持生物功能。
推荐理由:原文给出了水印嵌入方式与湿实验验证结果,读者可据此判断AI生成生物设计的溯源路径。
cohere@cohereAI 评分 推出 Cohere Embed 5:我们全新的 SOTA 嵌入模型家族。 通过 Embed 5 Pro 获得前沿能力,或通过 Embed 5 Fast 获得低延迟性能。
_akhaliq@_akhaliqAI 评分 gen_obligation@gen_obligationAI 评分 在 max 模式下结果更令人印象深刻!6.1 sol 的表现超过了 Opus 5.5,同时使用的 token 少了 4 倍。
X:Peter Steinberger (@steipete)AI 评分 Fermion AI 发布 Phonon-2 语音识别模型,164MB 体积称平均准确率超过 Whisper large
Fermion AI 发布语音识别模型 Phonon-2,下载体积仅 164MB,官方称其平均准确率超过体积约为其 10 倍的 OpenAI Whisper large。该模型可在 MacBook Air 上 20 秒转写 1 小时音频,权重以 CC-BY-4.0 协议开放。
Simon WillisonAI 评分 GPT 6.1 Sol:以五分之一价格实现接近 Astra 的智能
Simon Willison 发布博文《GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price》,讨论 GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。原文未披露参数规模、benchmark 分数或具体定价等细节。
arcprize@arcprizeAI 评分