多模态信息提取

由信息提取节点直接读取 PDF 页面,结合版面和视觉信息提取字段。

开始前准备

准备 PDF 文件、字段 Schema 和输出卷。适合需要结合表格位置、页面区域或视觉内容判断字段的资料。图片文件使用解析信息提取

使用模板

在创建工作流页面选择“从模板开始”,搜索“多模态信息提取”并载入画布。

在参数表单中填写以下必填项。

配置

用途

源文件

选择要提取的 PDF 文件或文件夹

提取字段定义

用 JSON Schema 定义要从页面文本、表格和版面中提取的字段

输出位置

将结构化提取结果保存到 Catalog

保存参数后发起手动运行,系统先保存当前流程,再提交执行。

完整处理流程

连线表示执行顺序;各步骤通过模板配置的数据绑定取得输入。

多模态信息提取

配置页面提取

配置

使用方法

源文件

选择 PDF;检查卷内文件类型,避免混入其它格式

提取字段定义

定义字段名称、类型和含义;缺失值约定与类型保持一致

提取指令

说明应如何结合页面文本、表格及视觉证据判断字段

版面敏感字段

填写容易因位置混淆的字段名,例如付款方和收款方

输出位置

保存结构化 JSON 结果

模板直接将读取节点的 files 传给信息提取,不经过独立文档解析和分段。不要把普通文档模板的解析档位、分块设置机械套到这里。

提取采用 n_to_1,多个 PDF 共同形成一份结果。需要按文件分别提取时,应调整模式并同步修改结果保存方式。

检查页面证据和文件

  1. 运行后检查所选 PDF 和提取输入。

  2. 对照原页面查看提取的字段,特别是相邻区域中的同类信息。

  3. 检查可用的字段来源信息,确认依据来自正确页面。

  4. 查看保存节点返回的文件,在输出位置检查 JSON 结果。

本模板没有独立解析 ZIP。需要同时保存解析文档时,使用解析信息提取

示例:区分账单中的付款方与收款方

在 Schema 中分别定义 payerpayee,并在字段说明中解释两者。将这两个字段加入版面敏感字段,在指令中说明各自对应的页面区域。用一份 PDF 运行后,对照原文核对名称和位置,而不只检查字段是否非空。

常见问题

现象

检查与处理

相邻区域字段混淆

补充字段含义和页面位置要求,核对版面敏感字段名称

找不到解析 ZIP

此模板只保存提取 JSON;需要解析文件时选择解析信息提取

多份 PDF 内容合并

默认汇总模式;先确认这些文件是否属于同一提取任务

图片输入失败

改用支持图片解析的模板,并检查来源文件类型

继续阅读

最后更新于