清洗

清理文本中的空白、标签和指定噪声,也可以在保留来源信息的情况下清洗整个文档数组。

解析结果需要继续分段、提取或建立索引时,优先传递 documents;处理单段独立文本时,使用 text

选择输入

输入选择非空的 textdocuments,两者互斥。

节点会统一空白字符,因此原有换行和连续空格可能被合并。对依赖缩进、换行或表格排版的内容,应先判断是否适合清洗。

配置清洗规则

以下开关默认关闭,可按资料特点启用。

配置

作用

敏感信息打码

将匹配邮箱、电话号码样式的内容替换为 [masked]

Unicode 标准化

转换为 Unicode NFC

繁体转简体

将繁体中文转换为简体中文

去除 URL

删除匹配的 HTTP(S) 和 www 链接

去除不可见字符

删除控制字符和 Unicode 格式字符

去除 HTML 标签

去除文本中的 HTML 标签

特殊字符比例阈值和 N-Gram 重复比率阈值均取 0–1,默认 0 表示关闭。重复比率检查使用 3-Gram。

超过阈值时,节点报错并停止处理。清洗后内容为空也会报错。

使用输出

文本输入使用输出 text;文档数组输入使用输出 documents,其来源元数据会保留。下游继续使用文档数组,避免从纯文本重建记录。

示例:清理网页正文

流程示意:文档解析 → 清洗 → 分段。

绑定 documents,启用去除 HTML 标签和去除 URL。先用小样本检查正文是否完整,再决定是否启用比例阈值。

继续阅读

最后更新于