# 清洗

清理文本中的空白、标签和指定噪声，也可以在保留来源信息的情况下清洗整个文档数组。

解析结果需要继续分段、提取或建立索引时，优先传递 `documents`；处理单段独立文本时，使用 `text`。

## 选择输入

输入选择非空的 `text` 或 `documents`，两者互斥。

节点会统一空白字符，因此原有换行和连续空格可能被合并。对依赖缩进、换行或表格排版的内容，应先判断是否适合清洗。

## 配置清洗规则

以下开关默认关闭，可按资料特点启用。

| 配置 | 作用 |
| --- | --- |
| 敏感信息打码 | 将匹配邮箱、电话号码样式的内容替换为 `[masked]` |
| Unicode 标准化 | 转换为 Unicode NFC |
| 繁体转简体 | 将繁体中文转换为简体中文 |
| 去除 URL | 删除匹配的 HTTP(S) 和 www 链接 |
| 去除不可见字符 | 删除控制字符和 Unicode 格式字符 |
| 去除 HTML 标签 | 去除文本中的 HTML 标签 |

特殊字符比例阈值和 N-Gram 重复比率阈值均取 0–1，默认 0 表示关闭。重复比率检查使用 3-Gram。

超过阈值时，节点报错并停止处理。清洗后内容为空也会报错。

## 使用输出

文本输入使用输出 `text`；文档数组输入使用输出 `documents`，其来源元数据会保留。下游继续使用文档数组，避免从纯文本重建记录。

## 示例：清理网页正文

流程示意：文档解析 → 清洗 → 分段。

绑定 `documents`，启用去除 HTML 标签和去除 URL。先用小样本检查正文是否完整，再决定是否启用比例阈值。

## 继续阅读

- [变量与数据传递](../../variables-and-data.md)
- [运行与调试](../../run-debug.md)
