RAG 快速上手:从文档切分到检索问答的完整链路
发布于 2026-09-30
RAG 快速上手:从文档切分到检索问答的完整链路
让模型回答"我们自己的文档里写了什么",最实用的方案是 RAG(检索增强生成):先把文档切成片段存起来,提问时检索出最相关的片段,连同问题一起交给模型作答。
一、把文档变成文本
PDF/Word 优先转成结构化文本,保留标题层级(后续切分要用);
表格单独处理,转成 Markdown 比硬拆成句子更容易被模型理解;
顺手记录元数据:来源文件、章节、更新时间——回答时要用它作引用。
二、切分:这一步决定上限
三种常见切法,按优先级排序:
1. 按结构切(推荐):沿标题层级切,一个二级标题下的内容作为一个片段;
2. 按长度切:固定 300800 字一段,前后留一点重叠,避免语义被切断;
3. 按语义切:段落聚类后再切,效果更好,但实现成本高。
反例是把文档切成 100 字的小碎片:检索看似命中很多,拼起来却缺少上下文,模型只能猜。
三、检索:别只做向量
向量检索擅长语义相近,但会漏掉精确术语;把关键词检索加进来做混合检索,命中率明显提升;
检索结果按相关度排序后,取前 36 段通常足够;给得太多会稀释重点,还推高成本;
阈值过滤:相关度太低就宁可返回"没找到",也不要让模型硬编。
四、拼装上下文并作答
推荐的提示结构:
三点要求:只依据资料、标注来源、不确定就说不知道。
五、三个最容易踩的坑
切得太碎:片段之间失去上下文,答案自然不完整;
丢掉元数据:无法标注来源,用户不敢信;
不做评估:上线前准备 2050 个真实问题,每次调整切分或检索策略都跑一遍,用命中率与人工评分对比。
RAG 不是"接个向量库"就完事,切分质量与检索策略决定天花板,模型只是最后一步的表达。