清洗¶
清理文本中的空白、标签和指定噪声,也可以在保留来源信息的情况下清洗整个文档数组。
解析结果需要继续分段、提取或建立索引时,优先传递 documents;处理单段独立文本时,使用 text。
选择输入¶
输入选择非空的 text 或 documents,两者互斥。
节点会统一空白字符,因此原有换行和连续空格可能被合并。对依赖缩进、换行或表格排版的内容,应先判断是否适合清洗。
配置清洗规则¶
以下开关默认关闭,可按资料特点启用。
配置 |
作用 |
|---|---|
敏感信息打码 |
将匹配邮箱、电话号码样式的内容替换为 |
Unicode 标准化 |
转换为 Unicode NFC |
繁体转简体 |
将繁体中文转换为简体中文 |
去除 URL |
删除匹配的 HTTP(S) 和 www 链接 |
去除不可见字符 |
删除控制字符和 Unicode 格式字符 |
去除 HTML 标签 |
去除文本中的 HTML 标签 |
特殊字符比例阈值和 N-Gram 重复比率阈值均取 0–1,默认 0 表示关闭。重复比率检查使用 3-Gram。
超过阈值时,节点报错并停止处理。清洗后内容为空也会报错。
使用输出¶
文本输入使用输出 text;文档数组输入使用输出 documents,其来源元数据会保留。下游继续使用文档数组,避免从纯文本重建记录。
示例:清理网页正文¶
流程示意:文档解析 → 清洗 → 分段。
绑定 documents,启用去除 HTML 标签和去除 URL。先用小样本检查正文是否完整,再决定是否启用比例阈值。
继续阅读¶
最后更新于