图片解析

将图片中的文字和视觉内容转换为文档记录,供信息提取、文本处理和知识库索引使用。

票据截图、产品图片和扫描图片可以先经过本节点,再交给下游处理。图片描述生成的是文字;需要对图片本身建立向量索引时,使用图片嵌入

配置图片解析

从上游读取 MOI 卷绑定图片来源 sources。来源中的文件引用必须指向实际图片。

配置

说明

图片处理方式

ocr 提取图中文字;caption 生成图片描述。默认同时启用两项

图片描述输出语言

控制描述文字的语言,配置默认值为 zh

VLM OCR 模型

选择用于 OCR 和图片描述的视觉语言模型

只需要识别票据文字时,可选择 OCR;需要描述画面内容时,可选择图片描述。两项同时启用时,输出会包含相应的文字识别和图片描述内容。

使用输出

documents 是主要输出,其中保留图片来源元数据,文档类型为 image。需要纯文本时使用 text;文本为空时不返回该字段。

将完整 documents 传给信息提取或索引节点,保留后续追溯需要的来源信息。

示例:从票据图片提取字段

流程示意:读取 MOI 卷 → 图片解析 → 信息提取。

图片解析选择 OCR,将其 documents 绑定到信息提取节点,并在提取 Schema 中定义票据号码、日期和金额。图片解析负责提供文字证据,结构化字段由信息提取节点生成。

继续阅读

最后更新于