# 多模态信息提取

由信息提取节点直接读取 PDF 页面，结合版面和视觉信息提取字段。

## 开始前准备

准备 PDF 文件、字段 Schema 和输出卷。适合需要结合表格位置、页面区域或视觉内容判断字段的资料。图片文件使用[解析信息提取](document-extraction.md)。

## 使用模板

在创建工作流页面选择“从模板开始”，搜索“多模态信息提取”并载入画布。

在参数表单中填写以下必填项。

| 配置 | 用途 |
| --- | --- |
| 源文件 | 选择要提取的 PDF 文件或文件夹 |
| 提取字段定义 | 用 JSON Schema 定义要从页面文本、表格和版面中提取的字段 |
| 输出位置 | 将结构化提取结果保存到 Catalog |

保存参数后发起手动运行，系统先保存当前流程，再提交执行。

## 完整处理流程

连线表示执行顺序；各步骤通过模板配置的数据绑定取得输入。

![多模态信息提取](../images/multimodal-extraction-flow.svg)

## 配置页面提取

| 配置 | 使用方法 |
| --- | --- |
| 源文件 | 选择 PDF；检查卷内文件类型，避免混入其它格式 |
| 提取字段定义 | 定义字段名称、类型和含义；缺失值约定与类型保持一致 |
| 提取指令 | 说明应如何结合页面文本、表格及视觉证据判断字段 |
| 版面敏感字段 | 填写容易因位置混淆的字段名，例如付款方和收款方 |
| 输出位置 | 保存结构化 JSON 结果 |

模板直接将读取节点的 `files` 传给信息提取，不经过独立文档解析和分段。不要把普通文档模板的解析档位、分块设置机械套到这里。

提取采用 `n_to_1`，多个 PDF 共同形成一份结果。需要按文件分别提取时，应调整模式并同步修改结果保存方式。

## 检查页面证据和文件

1. 运行后检查所选 PDF 和提取输入。
2. 对照原页面查看提取的字段，特别是相邻区域中的同类信息。
3. 检查可用的字段来源信息，确认依据来自正确页面。
4. 查看保存节点返回的文件，在输出位置检查 JSON 结果。

本模板没有独立解析 ZIP。需要同时保存解析文档时，使用[解析信息提取](document-extraction.md)。

## 示例：区分账单中的付款方与收款方

在 Schema 中分别定义 `payer` 和 `payee`，并在字段说明中解释两者。将这两个字段加入版面敏感字段，在指令中说明各自对应的页面区域。用一份 PDF 运行后，对照原文核对名称和位置，而不只检查字段是否非空。

## 常见问题

| 现象 | 检查与处理 |
| --- | --- |
| 相邻区域字段混淆 | 补充字段含义和页面位置要求，核对版面敏感字段名称 |
| 找不到解析 ZIP | 此模板只保存提取 JSON；需要解析文件时选择解析信息提取 |
| 多份 PDF 内容合并 | 默认汇总模式；先确认这些文件是否属于同一提取任务 |
| 图片输入失败 | 改用支持图片解析的模板，并检查来源文件类型 |

## 继续阅读

- [工作流模板](index.md)
- [运行与调试](../run-debug.md)
