AI 知识库问答(RAG)原理:怎么准确作答
让 AI 客服准确作答,最大的拦路虎是大模型会一本正经地编答案,也就是幻觉。一个客户问公司的退款政策,模型若按训练记忆自由发挥,很可能说出一套并不存在的规则。RAG 就是目前业界应对这个问题的主流方案。
RAG(Retrieval-Augmented Generation,检索增强生成)是指在大模型生成回答之前,先从企业知识库中检索出与问题最相关的资料,再把这些资料连同问题一起交给模型,让它依据真实资料作答的技术。 它把作答从凭记忆自由发挥改成了照资料组织语言,是企业级 AI 客服准确性的基石。本文讲清它的两段式原理、为何能压制幻觉、知识库怎么搭,以及边界在哪。
RAG 的两段式原理
RAG 这个词拆开看,就是它的两个核心步骤:先检索(Retrieval),后生成(Generation)。
第一段:检索
系统先把企业的知识资料(产品文档、政策说明、FAQ 等)切成一段段,转成向量存进检索库。用户提问时,问题也被转成向量,系统据此从库里找出语义最接近的若干段资料。这一步的目标是把最可能含有答案的几段原文捞出来。
第二段:生成
检索到的资料段,连同用户的原始问题,被一起组织成一段提示词喂给大模型。模型被要求依据这些资料来回答,而不是凭自己的记忆。于是输出的答案就锚定在企业真实资料上。
用户提问
↓ [问题向量化]
向量检索(从知识库捞出最相关的几段原文)
↓ [资料 + 问题一起组成提示词]
大模型生成(依据资料作答,标注来源)
↓
返回答案 / 相关度过低则判定无答案转人工
这条链路在整套客服流程中处于作答环节,上游怎么把用户问题归类,参见AI 客服全流程拆解。
为什么 RAG 能减少幻觉
要理解 RAG 的价值,得先理解幻觉从哪来。大模型本质是根据概率续写最像样的文字,当它不掌握某个事实时,仍会硬凑出一个通顺但可能错误的答案,这就是幻觉。
RAG 的对策是:在模型作答前,先把参考答案摆到它面前。 模型不再需要从遥远的训练记忆里搜刮,而是照着检索来的真实资料组织语言,编造空间被大幅压缩。
但有两点必须清醒认识:
- RAG 减少幻觉,不等于消灭幻觉。 若检索到的资料本身过时或不相关,模型照样会答错,甚至会把错资料说得很笃定。
- 知识库质量是前提。 检索得再准,库里没有正确答案也是白搭。所以工程重心往往在知识库本身,而非模型。
知识库构建与切分、更新要点
RAG 的效果,七成取决于知识库做得好不好。这一点和AI 客服选型里强调的知识库质量决定客服质量是一致的。几个关键要点:
内容来源与质量
- 从人工客服历史记录里提取高频问题及标准答案。
- 逐条核实准确性,剔除过期信息,避免把错误答案写进库。
- 对价格、政策类易变内容标注生效范围,方便后续维护。
切分(分块)
知识库不是整篇丢进去,而要切成合适大小的段落(chunk)。切分粒度影响检索效果:
| 切分方式 | 特点 | 风险 |
|---|---|---|
| 切得太大 | 一段含多个主题 | 检索到的段里夹杂无关信息,干扰生成 |
| 切得太小 | 上下文被切碎 | 一句答案被拆散,检索到半截 |
| 按语义切 | 一段一个完整主题 | 较理想,但需要按文档结构调优 |
更新维护
RAG 的一大优势是更新快——改一篇文档,回答立刻跟着变,不用重新训练模型。但前提是要建立持续维护机制:定期审查易变内容、把上线后未命中的问题补进库、淘汰过期段落。知识库一旦停止维护,就会逐渐过期失效。
答错与无答案时的兜底
再好的 RAG 也会遇到检索不到、检索错、生成偏的情况。兜底设计决定了它会不会把小问题闹成客诉。
- 判定无答案而非硬答:当检索结果相关度都很低时,系统应判定为无答案,给出我暂时没有这方面信息,已为您转接人工,而不是让模型硬凑。无答案是必须坦白的正常状态。
- 限定回答范围:通过提示词约束模型只依据检索资料作答,资料里没有的就不说,压制自由发挥。
- 高风险强制人工:价格承诺、合同条款、法律相关、退款纠纷等,即便检索到资料也建议转人工确认。
- 未命中回流:把答错和无答案的真实问题记录下来,作为知识库补充和切分调优的线索,形成迭代闭环。
质检环节怎么发现这些答错的会话,可参考AI 全量质检原理。
能力边界:RAG 做不到的事
RAG 强在有据可依,但它仍有清晰边界,需要人工兜底:
- 库里没有的,它答不了:RAG 只能基于已有知识库作答,全新政策、个性化情况无能为力。
- 需要推理判断的复杂问题:涉及多条政策权衡、个案裁量的,模型即便检索到资料也未必能正确组合,应转人工。
- 检索失准的连锁错误:问题表述刁钻导致检索捞错段,会让答案整体跑偏,这类靠置信度阈值和人工抽检发现。
- 情绪与信任场景:投诉、重大纠纷需要的是共情和担当,不是检索来的标准答案,必须由人接手。
承认这些边界、配好转人工通道,才是负责任的落地姿态。
小结
RAG 通过先检索真实资料、再依据资料生成的两段式机制,让 AI 客服的回答有据可依,从根上压制了大模型的幻觉。但它的效果高度依赖知识库质量与切分维护,且无法覆盖库外问题、复杂裁量和情绪场景。把知识库做扎实、把无答案当成必须坦白的正常状态、把高风险问题交给人工,才能让准确作答真正落地。
延伸阅读:上游的会话怎么被归类,见AI 客服全流程拆解;作答质量怎么被持续监督,见AI 全量质检原理;整体选型逻辑见AI 客服怎么选。
企客连连正在研发面向中小团队的客户经营工具,欢迎访问 /product/ 加入内测候补名单,提前体验知识库问答能力。
常见问题
RAG 是什么,和直接问大模型有什么区别?
RAG 是检索增强生成的简称,它在大模型回答前先做一步检索:从企业自己的知识库里找出与问题最相关的几段资料,再把这些资料连同问题一起喂给模型,让它依据这些资料作答。和直接问大模型相比,最大区别是答案有据可依,模型不再凭训练记忆自由发挥,而是基于检索到的真实资料组织语言,所以更准、更新得也快,更新一篇文档就能立刻改变回答。这也是企业级 AI 客服普遍采用 RAG 的核心原因。
RAG 为什么能减少大模型的幻觉?
大模型的幻觉,是指它在不知道答案时仍然编造出一个看起来很像样的回答。幻觉的根源之一是模型只能依赖训练时记住的内容,遇到企业内部信息或新政策就只能猜。RAG 通过先检索真实资料再生成,相当于在回答前把参考答案放到模型面前,让它照着抄和组织而不是凭空想,从而显著降低编造概率。但要注意,RAG 减少幻觉不等于消灭幻觉,如果检索到的资料本身就错或不相关,模型照样会答错,所以知识库质量是前提。
知识库找不到答案时该怎么处理?
找不到答案时最忌讳的是硬答,那正是幻觉高发区。合理做法分几层:一是让系统识别出检索结果相关度太低,判定为无答案,而不是强行拼凑;二是这种情况下不自由发挥,而是给出我暂时没有这方面的信息,已为您转接人工的兜底话术;三是把这类未命中问题记录下来,作为知识库补充的线索。把无答案当成一种正常且必须坦白的状态来设计,比让模型不懂装懂更能保住客户信任。
想第一时间用上 AI 获客 / 销售 / 客服工具?