许多学生在撰写英语语言学论文的讨论部分时,容易将结果重复一遍,缺乏深度分析。我们实验室在分析某大纲生成器时得出的体验是:真正有效的讨论需要将语料库检索数据与前人结论进行对比,并挖掘异常数据背后的原因。例如,在一项关于学术写作中衔接词使用频率的研究中,我们分析了420篇语言学论文,发现although的使用频率在非母语作者中显著偏高(p<0.05),这与Hyland(2005)的结论部分一致,但我们的数据还显示,这种过度使用在讨论章节尤为突出,可能源于作者对学术语气的刻意模仿。
为了量化这种偏差,我们引入困惑度(perplexity)作为文本自然度的指标:$PPL(W) = \sqrt[N]{\prod \frac{1}{P(w_i|w_1...w_{i-1})}}$。通过对比语料库中母语与非母语作者的困惑度,我们发现非母语作者的讨论部分困惑度平均高出15%,表明其语言模式更不自然。这一发现提示我们在写作中应避免机械套用模板,而应注重逻辑连贯性。
在对比文献观点时,我们建议采用批判性思维:不要简单说“与Smith(2018)一致”,而要指出“Smith(2018)基于口语语料,而我们的书面语数据显示相反趋势,这可能是因为语域差异”。这种对比能体现学术深度。