第九章 · 测试与评估体系
本章定位:前面八章讲了 SparkX RAG 的完整链路怎么工作。但系统搭起来后,怎么知道它工作得好不好? 用户问「退货政策」,召回的块对不对?意图分类准不准?图谱抽取的实体关系有没有用?靠「感觉」调参是调不好的,必须能量化测量。SparkX 内建了三个测试功能——召回测试、图谱测试、意图测试,分别针对 RAG 链路的不同环节,让你在上线前和运营中持续评估质量。
本章逐一拆解这三个测试:它们测什么、怎么测、结果怎么看、怎么用测试结果指导优化。
一、为什么 RAG 系统需要测试体系
1. RAG 是个「多环节链条」,每环都可能出问题
回顾前八章的 RAG 链路:
文档分块 → 向量化 → 检索(向量+关键词+图谱)→ 意图路由 → 重排 → 生成
每个环节都可能出问题:
- 分块切坏了 → 检索召回的块是残缺的;
- 向量模型选错了 → 语义相似度算得不准;
- 意图分类错了 → 路由到错误的库;
- 图谱实体抽错了 → 子图扩展找错关联。
如果只看最终答案质量,你根本不知道是哪一环出了问题——是检索没召回,还是召回了但生成 Prompt 写错了?
2. 分环节测试 = 精准定位问题
三个测试功能对应链路的三个关键环节:
| 测试 | 测哪个环节 | 回答什么问题 |
|---|---|---|
| 召回测试 | 检索(向量+关键词) | 「这个问题能召回对的内容吗?分数高不高?」 |
| 图谱测试 | 知识图谱检索 | 「实体抽对了吗?子图扩展找到关联块了吗?」 |
| 意图测试 | 意图分类 | 「问题被分到正确的意图节点了吗?准确率多少?」 |
每个测试只测一个环节,这样问题能精准定位——召回测试分低,就是检索/分块/向量化的问题;意图测试准确率低,就是意图配置或 Prompt 的问题。
💡 这就是「分环节测试」的价值:把「答案不好」这个模糊问题,拆成「哪个环节不好」的精准诊断。
二、召回测试(Hit Test)—— 检索质量的体检
1. 测什么
🔒 以上为本章部分预览(约 10%)
本章剩余 90% 内容包含:关键源码逐行拆解、设计细节与工程权衡、代码示例与生产实践要点。
加入知识星球,获取《SparkX 源码深度解析》全部 13 章
💡 本次展示的仅为部分预览内容(约 10%)。完整的源码深度解析包含每一个技术点的完整实现细节。点击上方按钮扫码加入知识星球,解锁全部内容。