文本去重器的工作原理与去重规则
文本去重器是一个用于清理文本列表的工具,其核心功能是识别并移除输入内容中的重复行。在处理文本时,工具会逐行扫描用户输入的列表,并仅保留每一行首次出现的内容,后续所有完全相同的重复行都会被过滤掉。
去重过程严格遵循以下匹配与保留规则:
- 精确匹配:两行文本必须完全一致才会被判定为重复,这包括行内的空格、制表符以及英文字母的大小写。
- 保留首次出现:当检测到重复行时,工具会保留该行第一次出现的位置,并直接删除后续所有重复的行。
- 保持原始顺序:去重后的结果会严格按照每一行在原始输入中首次出现的先后顺序进行排列,不会打乱列表的原始结构。
- 空行处理:空行在去重时被视为普通文本行。如果输入中存在多个空行,工具仅会保留第一个空行,其余的空行将被作为重复内容移除。
输入限制与错误处理
为了保证浏览器本地处理的性能,文本去重器对单次输入的数据量设有上限:
- 字符限制:输入框支持的最大文本长度为 500,000 个字符。
- 超限提示:如果输入的文本长度超过 500,000 个字符,系统将无法进行去重,并会显示错误信息:“这段文本太长了,请控制在
{max}个字符以内。”,此时原始、唯一和已移除的行数统计均会保持为 0。 - 常规错误:若遇到其他无法解析的异常情况,工具会显示通用错误提示:“无法去重这段文本。”。
界面状态与统计指标
在操作过程中,工具会根据不同的输入状态实时更新界面提示与数据统计:
| 状态/操作 | 界面提示信息 | 统计指标变化 |
|---|---|---|
| 无输入 | 添加多行文本后即可去重。 | 原始、唯一、已移除计数均为 0。 |
| 无重复行 | 没有发现重复行。已保留 {unique} 行。 |
原始与唯一行数相同,已移除为 0。 |
| 成功去重 | 已移除 {removed} 行重复内容,保留 {total} 行中的 {unique} 行。 |
实时显示原始、唯一和已移除的行数。 |
| 载入示例 | 示例已去重。 | 载入内置的示例数据并完成去重。 |
| 清空输入 | 已清空。 | 输入框与输出框均被清空,所有计数归 0。 |
| 应用结果 | 去重结果已移到输入框。 | 输出框的唯一行内容被移动至输入框。 |
当输入框为空时,界面中的“复制”和“使用结果”功能按钮将处于禁用状态。
浏览器本地处理与隐私保护
使用文本去重器处理数据时,所有的文本去重计算均在用户的浏览器本地完成。输入的文本列表不会被上传到 BroBroGo 服务器,这确保了数据处理过程的私密性,适合需要避免网络传输的文本清理工作。
常见问题
什么会算作重复行?
每一行必须完全相同才算重复,包括空格和大小写。第一次出现的行会保留,后面相同的行会移除。
会保留原来的顺序吗?
会。结果按每一行首次出现的位置排列,去重后列表仍保持原来的先后关系。
空行会怎样处理?
空行会像其他行一样处理。如果多个空行重复,只会保留第一次出现的那个空行。