在人工智能论文中,特征提取章节往往是审稿人重点关注的部分。我们实验室在分析某大纲生成器时得出的体验是:许多留学生习惯使用“we can get features”或“the system uses”这类口语化表达,导致论文被判定为Chinglish。例如,在一篇关于卷积神经网络特征提取的论文中,原句为“We can use PCA to reduce the dimension of features”,审稿人直接指出“can”显得主观且缺乏学术力度。我们建议改为“Principal component analysis (PCA) was employed to reduce feature dimensionality”,其中“employed”作为强动词,显著提升了客观性。
另一个常见问题是名词化缺失。比如“the model learns features quickly”应改写为“the model exhibits rapid feature learning capability”。这种名词化结构不仅更紧凑,还符合SCI论文的学术规范。我们在测试中发现,使用名词化改写后,段落可读性评分(Flesch Reading Ease)从45提升至62。
为了量化表达质量,我们引入困惑度(Perplexity)指标:$PPL(W) = \sqrt[N]{\prod \frac{1}{P(w_i|w_1...w_{i-1})}}$。在对比实验中,地道表达的困惑度通常低于50,而Chinglish表达往往超过80。这表明地道表达在语言模型下更自然,也更容易被审稿人接受。