最近我们实验室在辅导一批市场营销专业硕士论文时,发现一个普遍现象:学生使用ChatGPT或文心一言辅助写作后,提交到知网AIGC检测系统,重复率虽然降下来了,但“AI痕迹”指标却飙升至40%以上。导师一眼就能看出段落结构僵硬、过渡词泛滥。我们尝试了多种工具,最终总结出一套“深度去AI痕迹”的实战流程。
核心问题在于:大模型生成的文本在统计层面具有低困惑度(perplexity)。困惑度定义为 $PPL(W) = \sqrt[N]{\prod \frac{1}{P(w_i|w_1...w_{i-1})}}$,其中 $N$ 为句子长度,$P(w_i|\cdot)$ 为条件概率。AI生成的句子往往每个词的概率都很高,导致PPL值偏低,容易被检测模型识别。因此,降重的本质是提高文本的统计多样性,同时保持学术逻辑。
我们以一篇关于“社交媒体营销对消费者购买意愿影响”的实证论文为例,原始段落由AI生成,AIGC检测率为52%。通过以下步骤,我们将其降至8%以下。