# 法律知识微调数据生成

使用[数据集生成](dataset-generation.md)，根据法律资料和样本规则生成训练或评测数据。

1. 选择用于生成样本的资料来源。
2. 设置数据集目标和样本格式，例如问答对。
3. 在生成规则中说明问题范围、答案要求以及来源约束。
4. 定义输出字段，例如 question 与 answer，并选择保存位置。
5. 运行工作流。生成后对照原始资料核对条文、适用条件和引用内容，审校后再用于训练或评测。

## 准备资料与范围

选择有明确来源和版本的法律资料，记录适用范围和发布日期。将需要生成的问题范围写入规则，避免把不同版本的规定混成同一条答案。

本页说明数据准备方法。生成结果需要对照原始资料审校，不直接作为法律意见或未经核对的训练标签。

## 配置样本

| 配置 | 示例要求 |
| --- | --- |
| 数据集目标 | 根据实际用途选择微调数据或评测集 |
| 样本格式 | 问答对或指令微调样本，与输出结构一致 |
| 生成规则 | 限定资料范围；答案保留适用条件，不补写不存在的条文 |
| 输出 Schema | 定义问题、答案和来源字段，或训练系统需要的 instruction/input/output 结构 |
| 样本数量 | 先用小批量检查，实际数量以生成结果为准 |

先保持汇总模式。切换逐文档生成时，同时调整保存步骤以接收多结果。

## 审校生成结果

1. 检查问题是否能由指定资料回答。
2. 核对答案中的条文、适用条件、例外和引用。
3. 检查来源是否真实支持答案，删除无法核对的样本。
4. 去除重复或彼此矛盾的样本，统计实际可用数量。
5. 按训练或评测系统的格式要求转换并检查字段。

需要划分训练集与评测集时，检查相同资料产生的近似样本是否跨集合重复。保存输出文件及使用的规则，方便后续复核。

[返回工作流模板](index.md)
