内容哈希去重指用内容的哈希——通常是 sha256——来识别重复记录,而不是比较标题、文件名或元数据。只有字节一致,两条记录才是同一资产。
标题匹配找到的是候选,不是重复。在一次实测审计中,按标题匹配的 30 组"重复"里有 24 组在内容哈希下瓦解:同名的不同对话、只差一个内嵌标记的测试探针,还有内容毫不相干却共享同一来源引用的行。
全文哈希第一;剥除头部后的正文相似度第二;来源第三;创建时间间隔第四。而正文为空的行无法归类——去隔离区,不进合并队列。
本条目属于 untactit 术语表。定义基于博客上的实测文章。