跳到正文

#RAG

今日 0 条
10月2日周五
9月30日周三
9月29日周二
  1. AWS Machine Learning Blog29

    Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索

    Condé Nast 联合 AWS 生成式 AI 创新中心,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型,对视频转录文本、画面和音频联合编码,支持自然语言意图搜索、以图搜视频和时间戳定位,覆盖超 14 万条视频库。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 已死、Skills 杀死 MCP?

    GitHub Podcast 最新一期逐条拆解了五个 AI 热梗:AI 生成的代码仍需人来负责,只是审查力度应按风险分级;Skills 与 MCP 解决的是不同问题,前者是打包好的经验,后者是连接工具与数据的标准;RAG 并未消亡,它让模型从训练数据之外获取文档、内部知识和代码库上下文,检索不佳会浪费 token、拖慢速度并增加答案不完整的概率。

9月16日周三
9月3日周四
9月1日周二
8月26日周三
8月21日周五
8月20日周四
8月18日周二
  1. Hugging Face Blog62

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 式后期交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也可通过同一 API 使用。

    推荐理由:原文给出多向量编码器的加载、打分与索引接入方式,读者可据此判断现有检索栈的改造量。

6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 上为 93.07 分,官方称独立标注者在 600 多份文档的盲评中平均偏好率约 72%。

    推荐理由:OCR 4 把文档解析从纯文本扩展到带边界框和块分类的结构化输出,读者可据此判断它是否适合接入现有 RAG 或智能体流程。

6月5日周五
  1. Google Research60

    Google 在 Gemini Enterprise Agent Platform 上线 Agentic RAG 版跨语料检索

    Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过规划、改写、路由与充分上下文智能体迭代检索多源数据。官方称相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中正确路由并答对 90.1% 的问题,单语料与跨语料版本延迟差异平均在 3% 以内。

    推荐理由:原文给出多智能体 RAG 的完整流程与跨语料评测数据,读者可据此判断它在多源检索场景下的可用性。

6月1日周一
  1. Hugging Face Blog60

    JetBrains 发布 12B MoE 模型 Mellum2,Apache 2.0 开源

    JetBrains 发布 Mellum2,一个从零训练、覆盖自然语言与代码的 12B 参数 MoE 模型,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其在相近规模模型中基准表现有竞争力,推理速度超过 2 倍,可用于路由、RAG、摘要、子智能体和高吞吐编码场景。模型已在 Hugging Face 提供下载,技术报告发布在 arXiv(2605.31268)。

    推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,读者可据此判断它在多模型系统中的定位。

5月19日周二
5月18日周一
5月15日周五
10月23日周四
10月21日周二
10月1日周三
  1. Hugging Face Blog38

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入评测新基准

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评测嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,单个数据集至少含 1k 文档和 50 条查询。

9月4日周四
  1. Hugging Face Blog60

    Google 发布 EmbeddingGemma 多语言嵌入模型

    Google 发布 EmbeddingGemma,一个 308M 参数、2K 上下文窗口、支持 100 多种语言的多语言嵌入模型,面向端侧场景,量化后内存占用低于 200MB。

    推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的落地空间。

5月28日周三
5月27日周二
4月9日周三
3月7日周五
  1. Mistral AI76

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并已作为 Le Chat 文档理解的默认模型。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析在 RAG 流程中的落地成本。

7月16日周二
  1. Hugging Face Blog28

    如何用 distilabel 打造 Argilla 2.0 聊天机器人

    这篇教程展示了如何用 distilabel 为 Argilla 2.0 构建能理解技术文档的聊天机器人:先从 GitHub 文档生成合成数据集并微调领域专用嵌入模型,再搭建向量数据库存储和检索文档。最终聊天机器人部署在 Hugging Face Space 上,交互记录存入 Argilla 用于持续评估与改进。

7月9日周二
6月7日周五
5月14日周二
5月9日周四
3月22日周五
  1. Hugging Face Blog62

    Hugging Face 详解嵌入向量二值与标量量化:检索更快更省

    Hugging Face 博客介绍嵌入向量的二值(binary)与标量(int8)量化,用于降低检索的内存、磁盘占用与成本。二值量化把 float32 值转为 1-bit,内存和存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化缩小 4 倍,平均带来 3.66 倍检索加速,二值量化平均加速 24.76 倍。

    推荐理由:原文给出二值与标量量化的实测数据与可复用脚本,读者可据此评估检索成本与性能的取舍。

3月15日周五
7月13日周三
  1. Hugging Face Blog30

    如何用 Sentence Transformers 构建歌单生成器

    用 Sentence Transformers 的语义搜索搭建歌单生成器:将歌词按段落切块并嵌入,以 msmarco-MiniLM-L-6-v3 生成提示词嵌入,检索最相近的段落,top_k=20 时通常能得到至少 9 首不同歌曲。整个多步 Gradio 应用基于 Blocks API 构建并托管在 Hugging Face Spaces,歌词嵌入已发布在 Hugging Face Hub 上。

6月23日周四
  1. Hugging Face Blog36

    Hugging Face 教程:如何用 Embeddings 快速搭建 FAQ 语义搜索

    Hugging Face 发布入门教程,演示如何用 Sentence Transformers 的 all-MiniLM-L6-v2 模型和 Inference API 为美国 Medicare FAQ 数据集生成嵌入向量,并上传至 Hub 免费托管。用户查询经嵌入后与数据集比对,即可找出语义最相似的 FAQ 条目。首次调用 API 约需 20 秒下载模型,后续请求会明显加快。

3月16日周三
  1. Hugging Face Blog22

    用 🤗 datasets 实现图像搜索

    Hugging Face 的 🤗 datasets 现已支持图像特征类型,可结合 sentence_transformers 和 faiss 为图像数据集构建相似度搜索应用。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接载入含 image 和 label 特征的 10000 行数据,并利用 datasets 内置的 faiss 索引能力实现图像检索。