第九章 · 测试与评估体系

本章定位:前面八章讲了 SparkX RAG 的完整链路怎么工作。但系统搭起来后,怎么知道它工作得好不好? 用户问「退货政策」,召回的块对不对?意图分类准不准?图谱抽取的实体关系有没有用?靠「感觉」调参是调不好的,必须能量化测量。SparkX 内建了三个测试功能——召回测试、图谱测试、意图测试,分别针对 RAG 链路的不同环节,让你在上线前和运营中持续评估质量。

本章逐一拆解这三个测试:它们测什么、怎么测、结果怎么看、怎么用测试结果指导优化。


一、为什么 RAG 系统需要测试体系

1. RAG 是个「多环节链条」,每环都可能出问题

回顾前八章的 RAG 链路:

文档分块 → 向量化 → 检索(向量+关键词+图谱)→ 意图路由 → 重排 → 生成

每个环节都可能出问题:

  • 分块切坏了 → 检索召回的块是残缺的;
  • 向量模型选错了 → 语义相似度算得不准;
  • 意图分类错了 → 路由到错误的库;
  • 图谱实体抽错了 → 子图扩展找错关联。

如果只看最终答案质量,你根本不知道是哪一环出了问题——是检索没召回,还是召回了但生成 Prompt 写错了?

2. 分环节测试 = 精准定位问题

三个测试功能对应链路的三个关键环节:

测试 测哪个环节 回答什么问题
召回测试 检索(向量+关键词) 「这个问题能召回对的内容吗?分数高不高?」
图谱测试 知识图谱检索 「实体抽对了吗?子图扩展找到关联块了吗?」
意图测试 意图分类 「问题被分到正确的意图节点了吗?准确率多少?」

每个测试只测一个环节,这样问题能精准定位——召回测试分低,就是检索/分块/向量化的问题;意图测试准确率低,就是意图配置或 Prompt 的问题。

💡 这就是「分环节测试」的价值:把「答案不好」这个模糊问题,拆成「哪个环节不好」的精准诊断


二、召回测试(Hit Test)—— 检索质量的体检

1. 测什么


🔒 以上为本章部分预览(约 10%)

本章剩余 90% 内容包含:关键源码逐行拆解、设计细节与工程权衡、代码示例与生产实践要点。

加入知识星球,获取《SparkX 源码深度解析》全部 13 章

💡 本次展示的仅为部分预览内容(约 10%)。完整的源码深度解析包含每一个技术点的完整实现细节。点击上方按钮扫码加入知识星球,解锁全部内容。

🔒

本章为知识星球会员专属内容

完整源码解析、设计决策与落地实践,加入知识星球即可解锁全部章节。

知识星球
🌟 加入知识星球
解锁源码与设计详解
知识星球二维码 了解详情