计算机科学论文中,算法框架部分往往是重复率的重灾区。我们实验室在分析某大纲生成器时得出的体验是:许多学生直接复制经典算法的伪代码或描述,导致查重系统标记为高相似度。例如,一篇关于卷积神经网络优化的论文,其核心算法描述与某开源项目文档的匹配度高达78%。要降低重复率,首先需要理解查重报告中的关键指标:相似度来源、匹配段落长度、以及重复类型(如直接复制、改写不足)。
我们建议采用“语态逆转”与“词性替换”组合策略。语态逆转指将被动语态转为主动语态,或将陈述句转为条件句。例如,原文“The algorithm is initialized with random weights”可改写为“We initialize the algorithm using random weights”。词性替换则涉及将名词转为动词、形容词转为副词等。例如,“the convergence rate of the model”可改为“the model converges rapidly”。
数学公式也能辅助降重。例如,在描述损失函数时,可引入公式 $L(\theta) = -\frac{1}{N}\sum_{i=1}^N [y_i \log \hat{y}_i + (1-y_i) \log (1-\hat{y}_i)]$,并用文字解释其变体,从而降低文本重复。我们在测试中发现,结合公式的段落重复率平均降低12%。