法律知识微调数据生成¶
使用数据集生成,根据法律资料和样本规则生成训练或评测数据。
选择用于生成样本的资料来源。
设置数据集目标和样本格式,例如问答对。
在生成规则中说明问题范围、答案要求以及来源约束。
定义输出字段,例如 question 与 answer,并选择保存位置。
运行工作流。生成后对照原始资料核对条文、适用条件和引用内容,审校后再用于训练或评测。
准备资料与范围¶
选择有明确来源和版本的法律资料,记录适用范围和发布日期。将需要生成的问题范围写入规则,避免把不同版本的规定混成同一条答案。
本页说明数据准备方法。生成结果需要对照原始资料审校,不直接作为法律意见或未经核对的训练标签。
配置样本¶
配置 |
示例要求 |
|---|---|
数据集目标 |
根据实际用途选择微调数据或评测集 |
样本格式 |
问答对或指令微调样本,与输出结构一致 |
生成规则 |
限定资料范围;答案保留适用条件,不补写不存在的条文 |
输出 Schema |
定义问题、答案和来源字段,或训练系统需要的 instruction/input/output 结构 |
样本数量 |
先用小批量检查,实际数量以生成结果为准 |
先保持汇总模式。切换逐文档生成时,同时调整保存步骤以接收多结果。
审校生成结果¶
检查问题是否能由指定资料回答。
核对答案中的条文、适用条件、例外和引用。
检查来源是否真实支持答案,删除无法核对的样本。
去除重复或彼此矛盾的样本,统计实际可用数量。
按训练或评测系统的格式要求转换并检查字段。
需要划分训练集与评测集时,检查相同资料产生的近似样本是否跨集合重复。保存输出文件及使用的规则,方便后续复核。
最后更新于