# 图片解析

将图片中的文字和视觉内容转换为文档记录，供信息提取、文本处理和知识库索引使用。

票据截图、产品图片和扫描图片可以先经过本节点，再交给下游处理。图片描述生成的是文字；需要对图片本身建立向量索引时，使用[图片嵌入](image-embedding.md)。

## 配置图片解析

从上游[读取 MOI 卷](../data-io/read-volume.md)绑定图片来源 `sources`。来源中的文件引用必须指向实际图片。

| 配置 | 说明 |
| --- | --- |
| 图片处理方式 | `ocr` 提取图中文字；`caption` 生成图片描述。默认同时启用两项 |
| 图片描述输出语言 | 控制描述文字的语言，配置默认值为 `zh` |
| VLM OCR 模型 | 选择用于 OCR 和图片描述的视觉语言模型 |

只需要识别票据文字时，可选择 OCR；需要描述画面内容时，可选择图片描述。两项同时启用时，输出会包含相应的文字识别和图片描述内容。

## 使用输出

`documents` 是主要输出，其中保留图片来源元数据，文档类型为 `image`。需要纯文本时使用 `text`；文本为空时不返回该字段。

将完整 `documents` 传给信息提取或索引节点，保留后续追溯需要的来源信息。

## 示例：从票据图片提取字段

流程示意：读取 MOI 卷 → 图片解析 → 信息提取。

图片解析选择 OCR，将其 `documents` 绑定到信息提取节点，并在提取 Schema 中定义票据号码、日期和金额。图片解析负责提供文字证据，结构化字段由信息提取节点生成。

## 继续阅读

- [变量与数据传递](../../variables-and-data.md)
- [运行与调试](../../run-debug.md)
