法律知识微调数据生成

使用数据集生成,根据法律资料和样本规则生成训练或评测数据。

  1. 选择用于生成样本的资料来源。

  2. 设置数据集目标和样本格式,例如问答对。

  3. 在生成规则中说明问题范围、答案要求以及来源约束。

  4. 定义输出字段,例如 question 与 answer,并选择保存位置。

  5. 运行工作流。生成后对照原始资料核对条文、适用条件和引用内容,审校后再用于训练或评测。

准备资料与范围

选择有明确来源和版本的法律资料,记录适用范围和发布日期。将需要生成的问题范围写入规则,避免把不同版本的规定混成同一条答案。

本页说明数据准备方法。生成结果需要对照原始资料审校,不直接作为法律意见或未经核对的训练标签。

配置样本

配置

示例要求

数据集目标

根据实际用途选择微调数据或评测集

样本格式

问答对或指令微调样本,与输出结构一致

生成规则

限定资料范围;答案保留适用条件,不补写不存在的条文

输出 Schema

定义问题、答案和来源字段,或训练系统需要的 instruction/input/output 结构

样本数量

先用小批量检查,实际数量以生成结果为准

先保持汇总模式。切换逐文档生成时,同时调整保存步骤以接收多结果。

审校生成结果

  1. 检查问题是否能由指定资料回答。

  2. 核对答案中的条文、适用条件、例外和引用。

  3. 检查来源是否真实支持答案,删除无法核对的样本。

  4. 去除重复或彼此矛盾的样本,统计实际可用数量。

  5. 按训练或评测系统的格式要求转换并检查字段。

需要划分训练集与评测集时,检查相同资料产生的近似样本是否跨集合重复。保存输出文件及使用的规则,方便后续复核。

返回工作流模板

最后更新于