本发明公开了一种基于结构和内容二级过滤的 Web 数据相似性检测方法,在传统的通用相似性检测 方法的基础上,发掘出 Web 数据结构和内容分布的特点,对检测的文档集进行两级过滤;两级过滤中的 第一级过滤是结构相似性过滤,对每个Web文档建模为Tag树结构,从而剔除在结构上不相似的文档集, 并对剩余的文档进行关键内容抽取,将其表示成元组向量的形式,将关键信息连接起来生成字符串集; 两级过滤中的第二级过滤则对第一级过滤后生成的字符串集进行 Trie