# 分段与语义

## 选择配置对象

| 现象 | 进入位置 | 先检查什么 |
| --- | --- | --- |
| 文件内容缺段、串段或引用无关内容 | **智能分段** | 预览、分段内容、启用状态和当前版本 |
| 文件没有可读预览或没有分段 | [管理知识库数据](files-and-tables.md) | 处理状态、错误信息和源文件 |
| 表的指标、筛选或联表结果不正确 | **语义配置** | 维度、指标、关联和术语 |
| 资料已经换版 | [管理知识库数据](files-and-tables.md) | 新数据的处理状态和旧数据的启用状态 |

保存分段或语义配置后，使用[对话与检索](chat-search.md)中的真实问题验证结果。

## 配置文件分段

开始前，请在[管理知识库数据](files-and-tables.md)中确认文件已添加，且处理状态为 **就绪**。

### 打开文件详情

1. 打开目标知识库的 **高级配置**。
2. 打开 **数据** 页签。
3. 点击目标文件名称。
4. 打开 **智能分段**。

**文件预览** 用于检查解析内容，**文件信息** 用于查看标签和启用状态，**版本记录** 用于查看分段版本。

如果预览显示没有可用解析内容，请先回到[管理知识库数据](files-and-tables.md)检查处理状态和错误信息。

### 检查分段

1. 在 **智能分段** 中确认分段列表有内容。
2. 列表为空时，点击 **生成初始分段**。
3. 使用 **搜索分段** 定位内容。
4. 使用 **分段排序** 按原文顺序或召回优先查看分段。
5. 检查关键分段的正文、图片、表格或转录内容。

| 问题 | 处理方式 |
| --- | --- |
| 分段过碎 | 合并或调整正文，使一个分段保留完整语义 |
| 分段过粗 | 拆分正文，避免命中内容过大 |
| 内容乱码或错段 | 检查源文件和解析内容，再编辑分段 |
| 无关内容仍参与检索 | 停用对应分段 |

分段类型和可用字段以界面显示为准，例如文本、图片、图文、表格或转录。

### 编辑分段

仅当前生效版本可以编辑。

| 操作 | 步骤 |
| --- | --- |
| 编辑分段 | 选择 **编辑分段**，修改内容后保存 |
| 新建分段 | 选择 **新建分段**，输入正文后保存 |
| 停用分段 | 关闭 **启用分段** |
| 删除分段 | 选择 **删除分段** 并确认 |
| 更新向量 | 修改影响检索的内容后，选择 **重新 embedding** |

编辑图片、表格或转录分段时，按界面提供的 OCR、图片描述、表格预览或播放功能检查内容。

完成修改后，检查当前版本，执行 **重新 embedding**，再用对话验证来源。

### 管理版本

1. 在文件详情中打开 **版本记录**。
2. 查看版本名称、变更人和变更时间。
3. 选择需要使用的版本。
4. 点击 **设为当前**。
5. 确认 **索引版本** 与预期一致。

| 现象 | 检查方式 |
| --- | --- |
| 无分段或生成失败 | 生成初始分段；仍失败时检查处理状态和源文件 |
| 修改后回答未变化 | 检查是否已重新 embedding，以及当前版本是否正确 |
| 回答包含无关内容 | 停用无关分段，或在数据列表中禁用整个文件 |
| 整份文件需要更新 | 重新添加数据，再检查分段版本 |

## 配置表语义

语义配置面向数据表，用于数据问答和 SQL 生成。控制台新增条目前，先在 **数据源** 页签添加至少一张数据表。

### 打开语义配置

1. 打开目标知识库的 **高级配置**。
2. 打开 **语义配置** 页签。
3. 如果尚无语义模型，按界面提示创建第一条语义条目。

### 新增语义条目

1. 点击 **新增条目**。
2. 选择条目类型。
3. 填写 **Key**，例如 `total_revenue`。
4. 选择关联表。
5. 填写列名、表达式、SQL 或定义等必填项。
6. 保存条目。

需要修改时，使用行内 **编辑**。需要移除时，使用 **删除** 并确认。

### 选择条目类型

| 类型 | 何时使用 | 填写内容 |
| --- | --- | --- |
| **维度列** | 按地区、时间或类别筛选 | 用于筛选或分组的列名 |
| **事实列** | 统计金额、数量等数值 | 可参与计算的列名 |
| **业务指标** | 定义固定统计口径 | 指标表达式 |
| **表关联** | 联合多个表分析 | 两张关联表和连接列 |
| **术语解释** | 解释业务术语 | 术语和定义 |
| **命名过滤** | 复用高频筛选条件 | 过滤表达式 |
| **列偏好** | 指定推荐或不推荐的列 | 推荐列和不推荐列 |
| **标准问答** | 固定高频问题的 SQL | 问题和 SQL |
| **规则注入** | 在生成 SQL 时应用业务规则 | 规则内容和应用阶段 |
| **SQL 结果集** | 复用已治理的 SQL | SQL 和说明 |

表关联中的两张表必须都是知识库已配置的数据表。先配置高频字段和业务口径，再补充表关联和样例。通过 API 创建条目时，参照[创建语义条目](../../../reference/api/ai-studio/resource-center/knowledge-bases/create-semantic-entry.md)中的完整字段说明。

### 导入、导出和校验

| 操作 | 用途 |
| --- | --- |
| **导出** | 备份或迁移语义条目 |
| **导入** | 从 JSON 批量写入语义条目 |
| **校验** | 检查语义配置完整性 |

导入仅适用于当前没有语义条目的知识库。执行前确认目标知识库为空，并检查导入内容。
