多模态信息提取¶
由信息提取节点直接读取 PDF 页面,结合版面和视觉信息提取字段。
开始前准备¶
准备 PDF 文件、字段 Schema 和输出卷。适合需要结合表格位置、页面区域或视觉内容判断字段的资料。图片文件使用解析信息提取。
使用模板¶
在创建工作流页面选择“从模板开始”,搜索“多模态信息提取”并载入画布。
在参数表单中填写以下必填项。
配置 |
用途 |
|---|---|
源文件 |
选择要提取的 PDF 文件或文件夹 |
提取字段定义 |
用 JSON Schema 定义要从页面文本、表格和版面中提取的字段 |
输出位置 |
将结构化提取结果保存到 Catalog |
保存参数后发起手动运行,系统先保存当前流程,再提交执行。
完整处理流程¶
连线表示执行顺序;各步骤通过模板配置的数据绑定取得输入。
配置页面提取¶
配置 |
使用方法 |
|---|---|
源文件 |
选择 PDF;检查卷内文件类型,避免混入其它格式 |
提取字段定义 |
定义字段名称、类型和含义;缺失值约定与类型保持一致 |
提取指令 |
说明应如何结合页面文本、表格及视觉证据判断字段 |
版面敏感字段 |
填写容易因位置混淆的字段名,例如付款方和收款方 |
输出位置 |
保存结构化 JSON 结果 |
模板直接将读取节点的 files 传给信息提取,不经过独立文档解析和分段。不要把普通文档模板的解析档位、分块设置机械套到这里。
提取采用 n_to_1,多个 PDF 共同形成一份结果。需要按文件分别提取时,应调整模式并同步修改结果保存方式。
检查页面证据和文件¶
运行后检查所选 PDF 和提取输入。
对照原页面查看提取的字段,特别是相邻区域中的同类信息。
检查可用的字段来源信息,确认依据来自正确页面。
查看保存节点返回的文件,在输出位置检查 JSON 结果。
本模板没有独立解析 ZIP。需要同时保存解析文档时,使用解析信息提取。
示例:区分账单中的付款方与收款方¶
在 Schema 中分别定义 payer 和 payee,并在字段说明中解释两者。将这两个字段加入版面敏感字段,在指令中说明各自对应的页面区域。用一份 PDF 运行后,对照原文核对名称和位置,而不只检查字段是否非空。
常见问题¶
现象 |
检查与处理 |
|---|---|
相邻区域字段混淆 |
补充字段含义和页面位置要求,核对版面敏感字段名称 |
找不到解析 ZIP |
此模板只保存提取 JSON;需要解析文件时选择解析信息提取 |
多份 PDF 内容合并 |
默认汇总模式;先确认这些文件是否属于同一提取任务 |
图片输入失败 |
改用支持图片解析的模板,并检查来源文件类型 |