用 Amazon Quick 与 Adjudicated Query 模式批量审查数千份租约合规性
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提问合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言翻译成固定类型操作并叙述结果。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中提取八个关键字段,并由独立的验证智能体复核,签名识别分歧时由 Amazon Textract 作为确定性裁决。
Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型,对视频转录文本、画面和音频联合编码,支持自然语言意图搜索、以图搜视频和时间戳定位,覆盖超 14 万条视频库。
GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。
Hugging Face 发布 NeoMME 系列多语言多模态编码器,含 260M 和 800M 两个版本,用单个双向 Transformer 直接处理文本 token 与原始图像 patch,无需独立视觉塔或因果语言模型,并以掩码离散扩散目标从零训练。
OpenAI 宣布医疗机构可将 EHR 及更多行业数据接入 ChatGPT,让临床医生安全获取患者背景信息与医学研究资料。ChatGPT 由此可连接可信医疗数据,用于临床场景中的信息调取。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 式后期交互检索及其完整训练流程。
Papers with Code 的混合搜索系统用 Hugging Face Jobs 做全量论文嵌入、Storage Buckets 做持久化中转、Inference Endpoints 提供在线查询的低延迟嵌入,目前维护超过 11 万篇来自 arXiv 和 Daily Papers 的论文嵌入。
Mistral 发布 Agentic Search,一种面向企业复杂文档的多步检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环的工具设计与两组基准数字,读者可据此判断它相对一次性 RAG 的取舍。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。
推荐理由:原文给出多向量编码器的加载、打分与索引接入方式,读者可据此判断现有检索栈的改造量。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。
推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过规划、改写、路由与充分上下文智能体迭代检索多源数据。官方称相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中正确路由并答对 90.1% 的问题,单语料与跨语料版本延迟差异平均在 3% 以内。
推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断它在多源检索场景下的可用性。
JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。
Hugging Face 发布 Ettin Reranker 系列六款 Sentence Transformers CrossEncoder 重排模型,参数规模从 17m 到 1b,均基于 Ettin ModernBERT 编码器,并开源训练数据与完整训练配方。
PaddleOCR 3.5 支持通过设置 engine="transformers" 将 Hugging Face Transformers 作为推理后端运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
IBM 在 Hugging Face 发布 Granite Embedding Multilingual R2 系列两款 Apache 2.0 多语言嵌入模型,均基于 ModernBERT,支持 200+ 语言、32K token 上下文(较 R1 提升 64 倍)并新增 9 种编程语言的代码检索。
OpenAI 在 ChatGPT 中推出 Company knowledge,把企业应用中的上下文引入 ChatGPT,生成针对具体业务的回答,并带有清晰的引用、安全、隐私和管理员控制。该功能现已面向 Business、Enterprise 和 Edu 用户开放。
Hugging Face 发布指南,梳理 Chandra、OlmOCR-2、PaddleOCR-VL、DeepSeek-OCR、dots.ocr、Granite-Docling-258M。
推荐理由:梳理了当前开源 OCR 模型的输出格式、基准与本地部署方式,可据此为具体文档场景选型。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。
Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。
Mistral AI 发布首款专为代码设计的嵌入模型 Codestral Embed,在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成、MCP 工具等内置连接器结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:原文给出内置连接器、持久记忆与多智能体编排的具体能力,读者可据此判断企业级智能体平台的搭建方式。
Mistral 提出用 LLM as a Judge 配合结构化输出评估 RAG 系统,让"裁判 LLM"按数值、二元或定性量表为"生成 LLM"的答案打分,再对评测数据集取平均得到加权总分。
Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。
推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析在 RAG 流程中的落地成本。
这篇教程展示了如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集并微调领域专用嵌入模型,再搭建向量数据库存储和检索文档。最终聊天机器人部署在 Hugging Face Space 上,交互记录存入 Argilla 用于持续评估与改进。
Banque des Territoires、Polyconseil 与 Hugging Face 合作,为法国 EduRénov 校园生态改造计划搭建基于 RAG 的主权数据方案,项目第一阶段已完成。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 用户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Hugging Face 与 LangChain 联合发布合作包 langchain-huggingface,可通过 pip install langchain-huggingface 安装。
Intel 在 OPEA 平台下展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
Hugging Face 博客介绍嵌入向量的二值(binary)与标量(int8)量化,用于降低检索的内存、磁盘占用与成本。二值量化把 float32 值转为 1-bit,内存和存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化缩小 4 倍,平均带来 3.66 倍检索加速,二值量化平均加速 24.76 倍。
推荐理由:原文给出二值与标量量化的实测数据与可复用脚本,读者可据此评估检索成本与性能的取舍。
Hugging Face 博客介绍如何借助 Optimum Intel 与 fastRAG,在基于 Xeon 的 CPU 上加速 BGE 等嵌入模型并接入现有 RAG 流程。
用 Sentence Transformers 的语义搜索搭建歌单生成器:将歌词按段落切块并嵌入,以 msmarco-MiniLM-L-6-v3 生成提示词嵌入,检索最相近的段落,top_k=20 时通常能得到至少 9 首不同歌曲。整个多步 Gradio 应用基于 Blocks API 构建并托管在 Hugging Face Spaces,歌词嵌入已发布在 Hugging Face Hub 上。
Hugging Face 发布入门教程,演示如何用 Sentence Transformers 的 all-MiniLM-L6-v2 模型和 Inference API 为美国 Medicare FAQ 数据集生成嵌入向量,并上传至 Hub 免费托管。用户查询经嵌入后与数据集比对,即可找出语义最相似的 FAQ 条目。首次调用 API 约需 20 秒下载模型,后续请求会明显加快。
Hugging Face 的 🤗 datasets 现已支持图像特征类型,可结合 sentence_transformers 和 faiss 为图像数据集构建相似度搜索应用。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接载入含 image 和 label 特征的 10000 行数据,并利用 datasets 内置的 faiss 索引能力实现图像检索。