信息提取¶
根据 JSON Schema,从文件或已解析文档中提取结构化字段,并保留可用的来源追踪信息。
适用于合同要素、票据字段、简历信息等有明确字段定义的任务。自由生成摘要可使用AI 推理。
定义输入和字段¶
输入选择上游解析结果 documents,或由本节点解析的文件引用 files,两者只填写一项。
配置 |
说明 |
|---|---|
提取 Schema |
必填 JSON Schema,定义字段名称、类型与约束 |
提取指令 |
可选自然语言说明,用于解释字段含义和提取要求 |
版面敏感字段 |
指定需要结合页面位置核对的字段,例如供应商与收件方 |
页码筛选 |
限定源文件页面;留空处理全部页面 |
调试记录 |
默认关闭;开启后记录部分调用详情,供排查提取问题使用 |
文件输入使用有效且不重复的 Catalog file_id。
选择提取模式¶
模式 |
结果与失败行为 |
|---|---|
汇总为一个结果 |
默认模式,全部输入共同生成一份结果 |
每个来源一个结果 |
按来源文件分别生成结果;可配置失败策略 |
n_to_n 默认使用 per_item:失败来源保留明确的错误对象,其余来源继续。选择 fail_fast 时,遇到失败即中止整批。批量入表前,先分开成功结果和错误对象,只写入成功提取的数据。
使用输出¶
result 是单个提取结果的 JSON 字符串,results 用于按来源返回的结果字符串。mode 表示实际模式;sources_tracking 提供可用的字段来源信息。
绑定到接受 JSON 对象的节点时,需要区分 JSON 字符串和对象。单结果可接到存至 MOI 表的 JSON 数据输入;多结果应先处理每项结果和错误状态。
示例:提取合同编号¶
流程示意:文档解析 → 信息提取 → 存至 MOI 表。
可使用以下 Schema 作为字段定义示意:
{
"type": "object",
"properties": {
"contract_number": {"type": "string", "description": "合同编号"}
},
"required": ["contract_number"]
}
选择汇总模式,并说明合同编号在文档中的含义。运行后核对提取出的合同编号及其来源。
继续阅读¶
最后更新于