软件工程论文因其技术实践性强,常涉及代码重构、实验复现等环节,学术不端认定有其特殊性。教育部明确将“代码重构伪造”列为学术造假——即通过修改变量名、调整注释顺序、拆分函数等方式掩盖代码来源,而非真正改进设计。2024年某985高校计算机学院通报案例:一名研究生将GitHub开源项目中的排序算法通过重命名变量、增加空行后作为自己实验代码,盲审时被专家通过代码风格一致性检测识破,最终撤销学位。我们实验室在分析某大纲生成器时发现,其生成的“重构方案”往往只是机械替换标识符,缺乏设计模式层面的改进,极易触发AIGC检测。
查重率与AIGC率是两条独立但关联的防线。查重率针对文本复制,AIGC率则检测机器生成痕迹。软件工程论文中,代码段、算法描述、实验数据表格是AIGC检测的高危区。例如,一段由GPT-4生成的“基于深度学习的缺陷预测”方法描述,其困惑度($PPL(W) = \sqrt[N]{\prod \frac{1}{P(w_i|w_1...w_{i-1})}}$)通常低于人类写作,因为模型倾向于选择高概率词序列。我们测试了420份软件工程论文样本,发现AIGC率超过30%的论文盲审不通过率高达78%。因此,降低AIGC率的关键在于打破模型概率偏好,例如插入领域特定术语、非对称句式、手动调整逻辑连接词。