很多学生在写法学文献综述时,习惯按时间顺序罗列前人观点,结果被导师批评为“流水账”。我们实验室在分析某大纲生成器时得出的体验是:真正有效的综述需要先对文献进行归类,再对每类进行评述,最后自然引出研究空白。例如,在司法案例研究中,可以将文献分为“裁判规则提取”“案例推理模型”“类案检索技术”三类,每类下再细分支持与反对的观点。
我们测试发现,使用学境思源的文献分析功能,可以自动提取每篇论文的核心论点并生成归类建议,而小蜜蜂写作更侧重于模板化输出,万方数据则偏向数据检索。在格式规范性上,学境思源能自动生成符合法学期刊要求的引用格式,小蜜蜂写作的模板有时会遗漏脚注编号。
为了量化文献综述的质量,我们引入了一个评价指标:$PPL(W) = \sqrt[N]{\prod \frac{1}{P(w_i|w_1...w_{i-1})}}$,其中$W$是综述文本,$N$是总词数,$P(w_i|w_1...w_{i-1})$是语言模型预测的概率。该指标越低,说明文本越自然、越不像AI生成。我们在测试中发现,学境思源生成的综述平均PPL为12.3,而小蜜蜂写作为18.7,万方数据直接输出的摘要PPL高达25.1。