---
myst:
  html_meta:
    "moi:status": "paper-verified"
---

# 知识库

知识库（Knowledge Base）是供 AI 检索的数据集：把[加工](../data/processing.md)好的表与文件划入范围，附一份使用说明；此后您提问，AI 在这个范围内检索并作答，答案可溯源到原文。从建库到问答，都在本页。

| 您的数据 | AI 的参与 |
|---|---|
| 加工好的表与文件被划入检索范围，附一份使用说明 | 提问时，AI 在范围内检索，依据检索结果与使用说明作答，答案附引用 |

## 创建知识库

知识库由两部分组成：

| 组成 | 作用 |
|---|---|
| 选定的数据 | 划定 AI 的检索范围：哪些表、哪些文件属于这个知识库 |
| 使用说明 | 告诉 AI 这批数据是什么、口径如何、适合回答什么问题 |

问答与[智能体](agent.md)都以知识库为检索对象；范围之外的数据，AI 不会检索到。

## 使用说明直接影响回答质量

使用说明不是备注——AI 检索与作答时会读取它。写清三件事：

- **数据是什么**：来源、范围、时间跨度。例如「2024—2025 年销售合同，含扫描件」。
- **口径与约定**：字段含义、单位、缩写等容易被误读的信息。
- **适合与不适合**：这批数据能回答什么，不能回答什么。

使用说明含糊时，检索的命中与回答的边界都会变差；写清上面三件事，是成本最低的质量手段。

## 提问

一次问答发生了什么：

1. 您的问题被转换为检索请求，在知识库范围内检索相关内容。
2. 检索到的片段，连同使用说明，一并交给模型。
3. 模型基于这些材料作答；答案附引用，沿[数据血缘](../data/organize.md)可回溯到原文。

验证一个新知识库，用两类问题：**原文中确有答案的**——检验答案是否正确、引用是否指向正确原文；**原文中没有答案的**——检验 AI 是否如实说明检索不到，而不是编造。

## 回答不理想时，逐段回查

回答的质量由整条数据链路决定，而不只由模型决定：

| 症状 | 先检查 | 前往 |
|---|---|---|
| 答案说「没有相关信息」，但原文里明明有 | 这份文件加工了吗？产物入库了吗？ | [数据加工](../data/processing.md) |
| 答案引用了无关内容 | 知识库范围是否过宽？使用说明是否说明了适用问题？ | 本页上方 |
| 答案口径错误（单位、时间、字段含义） | 使用说明是否交代了口径与约定？ | 本页上方 |
| 想确认某句话出自哪份文件 | 沿答案引用回溯血缘 | [数据目录](../data/organize.md) |

## 下一步

| 您想做的事 | 前往 |
|---|---|
| 让智能体用这个知识库执行任务 | [智能体](agent.md) |
| 从上传到问答完整走一遍 | [快速开始](../start/quickstart.md) |

> 面向 AI 代理的说明：检索前先读取知识库的使用说明；范围之外的数据不在检索结果中，不要凭空补全；回答必须基于检索结果并给出引用，检索为空时如实说明。
