查重报告中的红色标记往往集中在方法描述和结果分析部分,尤其是时间序列建模的段落。我们实验室在分析某经济学论文时发现,一段关于ARIMA模型阶数确定的文字重复率高达78%。查重系统对固定句式(如“单位根检验表明序列平稳”)特别敏感。要降低重复率,第一步是理解报告中的“相似来源”分布:是来自经典教材、已发表论文还是网络资源?例如,某篇研究中国GDP增长的时间序列论文,其“ADF检验”描述与三篇文献高度重合。针对这类问题,我们建议采用语态逆转和词性替换的组合策略。
语态逆转指将被动语态转为主动语态,或将主动转为被动。例如,“模型被用于预测”可改为“我们使用模型预测”。词性替换则是将名词动词化或形容词名词化。比如,“序列的平稳性”可改为“平稳序列”。我们在测试中发现,这两种方法结合使用可将重复率降低15-20个百分点。但需注意,过度修改可能破坏学术严谨性,因此要保留核心术语如“协整关系”“Granger因果”。
数学上,查重系统通常基于n-gram匹配。设文档$D$的n-gram集合为$G(D)$,重复率定义为$R = \frac{|G(D) \cap G(C)|}{|G(D)|}$,其中$C$为对比库。降低$R$的关键是增加$G(D)$中独特n-gram的比例。通过同义替换和句式重组,可有效减少与库的重叠。