大模型 + RAG 做线索打分:原理与落地
线索越来越多,销售时间却有限,谁先跟、谁后跟,靠的就是线索打分。传统做法是人写死一堆加减分规则,简单但死板,读不懂聊天里那种我们最近在看的软意向。大模型加 RAG,提供了一条让打分既有据可依又能理解语义的新路子。本文讲清它的原理、四步落地,以及和规则打分的区别和边界。
用大模型加 RAG 做线索打分,是指把线索的画像和行为特征交给大模型,让它对照知识库里的评分标准与历史成交案例来评估这条线索的成交可能性,并给出分数与打分理由的方法。 它的关键在于让模型依据资料判断,而不是凭训练记忆瞎打。要理解底层机制,可以先看RAG 是什么;而打分要服务的整套评分体系,见线索评分怎么做。
先看清:和规则打分的区别
在动手前,先想清楚为什么要引入大模型,而不是继续用规则打分。
| 维度 | 规则打分 | 大模型 + RAG 打分 |
|---|---|---|
| 怎么打分 | 人写死加减分规则 | 模型对照标准灵活判断 |
| 擅长什么 | 硬指标(画像是否匹配) | 软信号(语义意向) |
| 读不读得懂对话 | 读不懂 | 能从对话/备注提取意向 |
| 透明度 | 规则清晰可查 | 需让模型附打分理由 |
| 改起来 | 改规则即可 | 改知识库标准 |
结论很明确:两者不是替代关系。规则打分适合行业、规模、职位这类硬指标,稳定透明;大模型适合读懂非结构化的软意向。实践中常把规则做底盘、大模型做语义增强,结合使用。
第一步:提取线索特征
打分的原料是特征。把每条线索的信息整理成两类:
画像特征(Fit)
- 所在行业是否在目标范围
- 企业规模是否匹配理想客户
- 联系人职位是否在决策链上
行为与语义特征(Intent)
- 访问了哪些页面、停留多久(尤其定价页、产品页)
- 下载了什么资料、是否申请过演示
- 聊天记录或备注里透露的意向(如正在选型、预算待定)
前者是结构化的硬指标,后者尤其是语义意向,正是大模型的用武之地。
第二步:搭打分知识库
这是 RAG 的核心一层,决定打分准不准。知识库里应放的是评分依据,而不是泛泛的资料:
- 评分标准:什么样的线索算高分,各维度怎么权衡,写成清晰的判断准则。
- 理想客户画像(ICP):典型高价值客户长什么样。
- 历史成交案例特征:过往成交客户的共性,以及典型未成交线索的特征,给模型当参照。
知识库质量是前提。标准本身偏了,模型再聪明也只会一致地打偏。
第三步:模型依据资料打分
把线索特征和检索到的评分标准一起交给模型,让它对照标准评估,并要求它输出两样东西:
线索特征(画像 + 行为 + 语义意向)
↓ [RAG 检索评分标准 + ICP + 成交案例]
标准 + 特征一起交给大模型
↓ [模型对照标准评估]
输出:分数 + 打分理由(为什么高/低)
↓
辅助销售排序,优先跟进高分线索
特别强调要让模型附上打分理由。一个只给数字的黑箱分没法信也没法改;当它说出因为该线索访问定价页三次且职位为采购负责人,匹配高意向特征,你才能判断这分打得有没有道理,也才知道该往哪改标准。
这里给你一段能直接抄去改的提示词骨架,别小看结构,模型给分稳不稳跟提示词写法关系极大:
你是资深销售运营,负责给 B2B 线索打成交概率分。
【评分标准】{检索到的评分准则}
【理想客户画像】{检索到的 ICP}
【历史成交/未成交案例】{检索到的对照案例}
【待评估线索】{画像 + 行为 + 对话摘要}
请只依据以上标准打分,标准没覆盖的情况标注"信息不足",不要自行脑补。
输出 JSON:{score: 0-100, band: 高/中/低, reasons: [引用了哪条标准的短句], missing: [还缺什么信息]}
一个容易被忽略的细节:让模型输出 band(高/中/低)而不是只输出精确分数。销售真正用的是分档去排队,纠结 73 分还是 76 分没意义,两条线索都该进”高”这一档优先跟。但如果你把分数当成绝对刻度去卡阈值,会被模型天生的分数漂移坑到——同一批标准,今天普遍打 70、明天普遍打 60 是常事,分档能吸收这种抖动。建议分档就三挡,最多四挡,挡位越细越容易自欺欺人。
再补一条踩过的坑:一定要留 missing 字段。信息不足的线索如果被硬打成中分,会混进跟进队列浪费销售时间;让模型把”缺预算信息、缺决策链角色”明确列出来,运营就知道该去补哪块数据,而不是盲跟。
第四步:用真实成交数据校准
打分上线那一刻并不是终点,而是校准的起点。
- 回看高分线索的真实成交率:如果一批高分线索普遍没成交,说明标准偏乐观,要回头修知识库。
- 回看漏判的成交客户:那些最终成交却当初被打低分的,看看模型漏掉了哪些信号,补进标准。
- 定期迭代:评分标准不是一次写好就不动的,而是随产品和市场变化持续调整的活文档。
校准让打分从拍脑袋逐渐逼近经得起数据检验。怎么算准不准,别停留在感觉上,用一个简单指标就够:分档命中率。假设过去一个季度模型打了 200 条高分线索,其中 24 条最终成交,高分档成交率就是 12%;同期中分档 300 条成交 15 条,是 5%;低分档基本不成交。只要高分档成交率明显高于中分、中分高于低分,这个打分就在做正事——把好线索排到了前面。反过来,如果高分档 12% 而中分档 11%,两档几乎拉不开差距,说明模型没有真正区分能力,标准得推倒重写,而不是小修小补。
给你一个可以每月填一次的对照表,坚持三个月你就知道该往哪改:
| 分档 | 线索数 | 成交数 | 成交率 | 该做的动作 |
|---|---|---|---|---|
| 高 | 200 | 24 | 12% | 若低于中分,检查标准是否过松 |
| 中 | 300 | 15 | 5% | 关注被漏判上来的成交,补信号 |
| 低 | 500 | 5 | 1% | 若冒出成交,回看模型漏了什么 |
低分档里冒出来的成交尤其值得盯,那往往是模型看不见的信号——比如客户是老客户转介绍、或者线下见过面,这些数据压根没进知识库。补进去,下次它就认得了。
落地边界:它做不到的事
把边界讲清楚,才能用得稳。
- 不是最终裁决,是辅助排序:它帮销售把大概率有戏的线索排前面,但要不要投入、怎么跟,仍由销售判断。别让一个分数直接决定客户死活。
- 不会无中生有:特征太少、信息缺失的线索,模型也打不出有意义的分,垃圾进垃圾出。
- 标准偏则分偏:知识库里的标准若本身有偏差,模型只会稳定地错下去,所以校准不可省。
- 语义可能误读:模型可能把客套话误读成高意向,软信号类打分尤其需要人工抽检兜底。
承认这些边界、保留人工判断的最终权,AI 打分才是帮手而非麻烦。
常见误区:三个最容易翻车的地方
带团队做过几轮,发现翻车的地方高度集中,直接点名给你避坑。
第一个误区是把评分标准写成一堆形容词。知识库里写”优质客户就是意向强、匹配度高”,这种话模型读了等于没读,它没法据此判断。标准要写成可核对的具体条件:意向强,指的是三十天内访问定价页两次以上,或对话里出现明确时间点(这季度要上、月底前定);匹配度高,指员工数在你目标区间、行业在白名单里。越具体,模型给分越稳,你回头改也越有抓手。
第二个误区是一上线就全量替换销售的判断。正确节奏是先跑影子模式:让模型在后台照常打分,但销售还按老办法跟进,两三周后拿模型的分档和销售实际的成交结果一比,你就知道它靠不靠谱、哪档不准。跳过这一步直接让分数决定资源分配,一旦标准有偏,等于系统性地把销售引向错的线索,损失比没上还大。
第三个误区是知识库搭好就不管了。市场在变、产品在变、你的理想客户也在变,去年高价值的行业今年可能预算冻结。评分标准是活文档,至少一个季度回看一次,把这三个月新成交客户的共性补进去、把明显失效的旧标准删掉。不维护的知识库,用不了半年就会悄悄失准,而且失得没声没息,等你发现高分线索总跟不下来时,早浪费了一堆人力。
落地清单:从零到跑起来
如果你准备这周就动手,按这个顺序来,别跳步:
- 先翻出过去半年到一年的成交与流失记录,人肉总结出五到八条共性,这是知识库的种子,比任何理论模板都值钱。
- 把线索特征拆成画像(Fit)和行为(Intent)两栏,先确认这些字段你的系统真的采得到——采不到的字段写进标准也是空的。
- 用上面的提示词骨架跑二十条已知结果的老线索做回测,看模型给的分档和你已知的成交结果对不对得上,对不上就改标准,先别急着接生产数据。
- 接生产,但只做辅助排序,销售的跟进权一点不收。
- 每月填一次分档命中率表,连续跟三个月再决定要不要加大依赖。
这套流程的好处是每一步都有产出、都能验证,不会一头扎进去搞三个月才发现方向错了。
小结
用大模型加 RAG 做线索打分,原理是让模型依据知识库里的评分标准和历史案例来评估线索,而不是凭空打分。落地四步:提取画像与语义特征、搭好打分知识库、让模型附理由地打分、用真实成交数据持续校准。它和规则打分不是替代而是互补——规则管硬指标,大模型读软意向。始终把它当作辅助排序的参考工具而非一锤定音的判官,保留销售的最终判断和人工抽检,打分才能既灵活又可信。
企客连连正在研发面向中小团队的线索打分工具,欢迎访问 /product/ 加入内测候补名单,提前体验语义意向识别与自动排序能力。
常见问题
怎么用 AI 给销售线索打分?
用 AI 给线索打分,思路是让大模型依据资料判断而不是凭空打。具体分四步:第一步提特征,把线索的画像信息(行业、规模、职位)和行为信号(访问了什么页、下载了什么、聊过什么)整理出来。第二步搭知识库,把你的评分标准、理想客户画像、历史成交案例特征放进去,用 RAG 接给模型。第三步打分,让模型对照知识库里的标准来评估这条线索,给出分数和打分理由。第四步校准,用真实成交结果回头看分打得准不准,不断调整标准。关键是模型有据可依、给分还附理由,比黑箱打个数字更可信也更好改。
大模型 RAG 打分和传统规则打分有什么区别?
规则打分是人预先写死规则,比如下载白皮书加十分、访问定价页加五分,简单透明但很死板,遇到规则没覆盖的情况就抓瞎,也读不懂聊天里那种我们最近在选型的软意向。大模型加 RAG 打分则能理解非结构化信息,把一段对话、一份备注里的意向读出来,并对照知识库里的标准灵活判断,还能说出为什么这么打。两者不是替代关系:规则打分适合硬指标(画像是否匹配),大模型适合软信号(语义意向)。实践中常把规则打分做底盘、大模型做语义增强,结合起来既稳又灵活。
AI 给线索打的分准不准,能信吗?
诚实地说,刚上线时不能全信,准不准要靠数据慢慢校出来。AI 打分的准度取决于两件事:一是知识库里的评分标准和历史案例靠不靠谱,标准本身偏了分就偏;二是有没有用真实成交结果做校准。正确的用法是把它当辅助排序而不是最终裁决:让它帮销售把大概率有戏的线索排到前面,优先跟进,但具体要不要投入、怎么跟,仍由销售判断。同时持续比对高分线索的真实成交率,如果高分却普遍不成交,就回头修标准。当成会迭代的参考工具,而不是一锤定音的判官,它的价值才稳。
想第一时间用上 AI 获客 / 销售 / 客服工具?