
7 月 20 日,2026 夏季 InfiniTensor 训练营前沿模型方向第二课《检索增强的语言模型》开讲。
前置课程《AI 模型导论与推理基础原理》完整搭建了人工智能与深度神经网络的零基础核心认知体系,串联了 AI 发展迭代、网络原理、训练逻辑、特殊结构及模型任务等内容。
本节课将深入解析检索增强生成(RAG)的核心思想,回顾语言模型面临的挑战,梳理从早期经典工作到现代 Agentic RAG 的演进脉络,并分享团队开源项目 UltraRAG 的实践经验。
为什么大模型需要检索?
语言模型基础回顾
- 基本任务:根据已见文字预测后续内容。
- 架构演变:从 BERT(Masked LM,语义理解强)到 GPT/Decoder-only(自回归,当前主流)。
- 评价指标:困惑度(Perplexity),越低代表预测越准确(注:近年来指标探索仍在进行,并非完美)。
大模型的三大核心挑战

1.知识密集型场景的幻觉:在医学、法律、金融等精准领域,仅靠参数记忆易产生“似对非对”的错误答案。
2.知识时效性滞后:预训练结束后知识即定型,无法获取截断时间后的新信息(如现任总统变更),且后训练注入知识成本极高。
3.超长文本处理瓶颈:上下文窗口有限(即使标称很长,有效窗口可能仅 256K 左右),易遗漏分散在长文档中的关键信息。
RAG 的核心解法

- 基本思路:不强制模型记住所有知识,而是提供外部查找渠道。
- 数据来源:维基百科、新闻快照、企业私有文档、多模态数据等(规模可达万亿 Token)。
- 推理流程:用户提问 → 索引构建(切块+索引) → 召回相关文档 → 文档输入模型 → 生成答案。
检索技术
检索范式
1. 稀疏检索(Sparse Retrieval):
- 原理:关键词匹配(如 TF-IDF, BM25)。
- 优势:速度快、可解释性强、特定名词匹配精准。
2. 稠密向量检索(Dense Retrieval):
- 原理:利用 Encoder 或 Decoder-only 模型将文本编码为语义向量,计算余弦相似度/点积。
- 优势:理解语义歧义(如区分“苹果手机”与“吃的苹果”),支持百万/千万级快速召回(Faiss, Milvus)。
3. Top K
- 只取前 K 个相似性最高的作为召回结果

RAG 系统设计的三个核心问题
1. 检索什么?
- 最小单元:Chunk(切块/分片)。
- 策略权衡:固定长度 vs 语义切分;粒度太粗丢失细节,太细丢失上下文。需结合业务场景定制。
2. 如何使用检索?
- In-Context Learning(主流):直接将召回文档拼接在 Prompt 中,利用模型强大的上下文理解能力。
- 架构魔改(非主流):通过 Cross-Attention 注入中间层或影响 Logits(破坏模型结构,现已少用)。

3. 何时检索?
- 单次检索:每问一次查一次。
- 步进检索:每生成 N 个 Token 触发一次(信息及时但成本高)。
- Agentic 检索(先进):模型自主判断信息是否充足,按需决定是否检索。

经典 RAG 工作回顾
1. REALM (2020)
- 贡献:最早提出检索器与语言模型联合预训练。
- 机制:基于 BERT,将问题与召回文档拼接预测 Mask 词;通过带权重的答案求和解决多文档融合问题。
- 局限:受限于当时模型输入长度(512),做法较早期。


2. Retrieval-in-Context LM

- Retrieval-in-Context:验证了 RAG 对不同规模模型均有收益,小模型收益最大;探讨了 Query 长度(32 token 较优)及检索频率的平衡。
- DPR:开创性地使用稠密向量检索替代 BM25,奠定现代向量检索基础。
- Query 优化:原始 Query 可能嘈杂,需清洗、改写或提取关键词以提升召回率。

3. RETRO (架构魔改代表)

- 创新:不直接拼接文本,而是将召回文档转为向量,通过 Chunk Cross-Attention 注入 Transformer 中间层。
- 特点:模拟“写一点、查一点”的过程。
- 现状:因修改模型架构成本过高,目前已非主流路线。
4. kNN-LM (细粒度检索)

- 创新:检索单元从“文本块”细化为“Token/短语”。
- 原理:利用训练语料库作为记忆库,计算 Query 与前缀的距离,聚合 kNN 分数与模型预测概率。

- 洞察:隐藏向量具有语义结构;轻量级模型(100M)配合 kNN 可媲美大模型效果。

RAG 的新趋势与前沿发展
从 RAG 到 Agentic RAG
1.范式转变:2023 年后范式趋于统一(Prompt 拼接),重点转向精准知识获取。
2.多跳推理(Multi-hop):解决复杂关联问题(如“二舅邻居的女儿是谁”),引入 COT、GraphRAG 等技术。
3.推理能力注入:DeepSeek-R1 等模型推动 Reasoning 在知识获取中的应用,训练模型自主判断知识充足度。
知识整理:DeepNote
1.痛点:多轮检索导致上下文嘈杂、信息密度低。

2.方案:以“笔记”为中心的多轮迭代。
- 召回 → 生成初始笔记 → 基于笔记生成新问题 → 再召回 → 更新笔记。
- 引入“失败计数”机制,避免无效更新,直到信息充足停止。

3.效果:显著提升有效信息密度,优于简单拼接。
知识利用与对齐

1.痛点:SFT 仅能模仿分布,易损害通用能力;模型存在“内外知识冲突”(更信参数知识或被错误文档误导)。
2.方案:基于 DPO 的偏好优化。

- 构建正负样本:对比“纯内部知识回答”与“RAG 回答”的轨迹。
- 端到端优化:联合训练 Refinement 模块与 Generation 模块(长链路调优)。

3.效果:提升 RAG 准确率的同时,不损害甚至提升通用能力(Common Sense, Math 等)。
开源实践与工具推荐

UltraRAG 项目介绍
1.背景:解决科研复现难、工业 Demo 搭建复杂的痛点。
2.功能:
- 科研基建:快速复现基线方法。
- 工业应用:快速搭建类 ChatGPT 的演示系统。
3.成果:GitHub Star 5600+,曾登 GitHub Trending Top 2。
4.资源:
- 代码仓库:https://github.com/OpenBMB/UltraRAG
- 教程文档:https://ultrarag.openbmb.cn
- 开源数据集:https://modelscope.cn/datasets/UltraRAG/UltraRAG_Benchmark
加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

