我们实验室在分析某高校人工智能论文查重报告时发现,超过60%的重复集中在“特征提取”方法描述部分。查重系统通常将“使用卷积神经网络提取图像特征”这类句式判定为高重复,因为大量论文采用相似的表述。要降低重复率,首先需要理解查重算法的匹配逻辑:它基于连续n-gram(如5-gram)的字符串匹配,而非语义理解。因此,通过改变句子结构、替换同义词、调整语序即可有效规避。
以我们处理过的一篇关于“基于深度学习的医学图像特征提取”论文为例,原文写道:“我们采用预训练的ResNet-50模型提取CT图像中的纹理特征。”查重报告显示该句与三篇已发表论文重合。我们将其改写为:“针对CT图像中的纹理信息,本研究借助预训练的ResNet-50架构完成特征抽取。”同时将“提取”替换为“抽取”、“采用”替换为“借助”,并调整语序。修改后重复率从34%降至12%。
一个实用的降重公式是:$PPL(W) = \sqrt[N]{\prod \frac{1}{P(w_i|w_1...w_{i-1})}}$,其中PPL表示困惑度,越低说明句子越自然。我们在改写时保持PPL在50-80之间,既降低重复又确保可读性。