Cohere Embed 5 首个采用 RCP-nDCG@10 评测的模型系列
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评测的模型系列,这是其最新评测方法,旨在改进对真实检索质量的评估。该系列基准测试结果因此呈现不同面貌。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评测的模型系列,这是其最新评测方法,旨在改进对真实检索质量的评估。该系列基准测试结果因此呈现不同面貌。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法用于改进真实场景检索质量评估。传统 nDCG 只计算已在基准答案集中的结果,RCP-nDCG@10 则按每条结果的实际相关性打分,结果由人工评审和 MTEB 支撑。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
Perplexity 发布上下文嵌入模型 pplx-embed-v2-context-9b-preview,该模型在 ConTEB 和 turbopuffer 的 context-bench 上取得新的 SOTA。
Perplexity 开源其上下文嵌入模型,称在 turbopuffer 的 context-bench 上表现最佳。该模型采用新的训练方式,让每个文档分块的编码都能看到整篇文档,pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的私有 context-bench 上刷新了 SOTA。
Perplexity 推出 pplx-embed-v2-context-9b-preview,通过从查询感知上下文压缩模型蒸馏相关性信号,突破单一 gold chunk 监督限制,在 ConTEB 和 turbopuffer 的 context-bench 上取得新 SOTA。
Perplexity 推出 pplx-embed-v2-context-9b-preview,在 ConTEB 上取得所测模型中最高的平均 nDCG@10,并在 turbopuffer 私有的 context-bench 上刷新 SOTA。
Perplexity 用查询感知上下文压缩模型蒸馏相关性信号,训练出上下文嵌入模型 pplx-embed-v2-context-9b-preview,在 ConTEB 和 turbopuffer 私有的 context-bench 上取得新的 SOTA。
Cohere Embeddings 团队推出 embed5 模型,通过新的训练与评估技术,不仅能检索相关结果,还能找出最符合人类偏好的文档。该模型重点强化多语言能力,并带来大幅吞吐量提升,可扩展至任意数据规模,同时强调用户数据始终私密。
Cohere 推出 Embed 5 系列嵌入模型,含 Embed 5 Pro 与 Embed 5 Fast 两款。Embed 5 Pro 在 ViDoRe V3 上取得所测模型最高平均分,超过 Voyage 4 Large、Gemini Embedding 2 和 Jina Embeddings v5,训练覆盖 100 多种语言。
Cohere Embed 5 现已通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 提供,也可直接在 North 中使用。Embed 5 的 Pro 与 Fast 两个版本共享同一嵌入空间,可用其中一个建索引、另一个检索,同时保持性能。
Cohere 发布 Embed 5 系列嵌入模型,分为 Embed 5 Pro 和 Embed 5 Fast 两档。Embed 5 Pro 在 ViDoRe V3 上取得所测模型的最高平均分,超过 Voyage 4 Large、Gemini Embedding 2 和 Jina Embeddings v5,并支持图像检索、解析后的 PDF 以及 100 多种语言训练。
Hugging Face 发布 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 直接处理文本 token 与原始图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。
推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排模型,参数规模从 17m 到 1b,均基于 Ettin ModernBERT 编码器,并开源训练数据与完整训练配方。
IBM 在 Hugging Face 发布 Granite Embedding Multilingual R2 系列两款 Apache 2.0 多语言嵌入模型,均基于 ModernBERT,支持 200+ 语言、32K token 上下文(较 R1 提升 64 倍)并新增 9 种编程语言的代码检索。
Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。
Mistral AI 发布首款专为代码设计的嵌入模型 Codestral Embed,在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。