RAG 快速上手:从文档切分到检索问答的完整链路

发布于 2026-09-30

RAG 快速上手:从文档切分到检索问答的完整链路

让模型回答"我们自己的文档里写了什么",最实用的方案是 RAG(检索增强生成):先把文档切成片段存起来,提问时检索出最相关的片段,连同问题一起交给模型作答。

一、把文档变成文本

PDF/Word 优先转成结构化文本,保留标题层级(后续切分要用);

表格单独处理,转成 Markdown 比硬拆成句子更容易被模型理解;

顺手记录元数据:来源文件、章节、更新时间——回答时要用它作引用。

二、切分:这一步决定上限

三种常见切法,按优先级排序:

1. 按结构切(推荐):沿标题层级切,一个二级标题下的内容作为一个片段;

2. 按长度切:固定 300800 字一段,前后留一点重叠,避免语义被切断;

3. 按语义切:段落聚类后再切,效果更好,但实现成本高。

反例是把文档切成 100 字的小碎片:检索看似命中很多,拼起来却缺少上下文,模型只能猜。

三、检索:别只做向量

向量检索擅长语义相近,但会漏掉精确术语;把关键词检索加进来做混合检索,命中率明显提升;

检索结果按相关度排序后,取前 36 段通常足够;给得太多会稀释重点,还推高成本;

阈值过滤:相关度太低就宁可返回"没找到",也不要让模型硬编。

四、拼装上下文并作答

推荐的提示结构:

三点要求:只依据资料、标注来源、不确定就说不知道。

五、三个最容易踩的坑

切得太碎:片段之间失去上下文,答案自然不完整;

丢掉元数据:无法标注来源,用户不敢信;

不做评估:上线前准备 2050 个真实问题,每次调整切分或检索策略都跑一遍,用命中率与人工评分对比。

RAG 不是"接个向量库"就完事,切分质量与检索策略决定天花板,模型只是最后一步的表达。

返回列表 · 技术交流