在计算机科学论文中,实证分析部分常被视为“流水账”的重灾区。许多研究者跑完SPSS或Stata后,直接堆砌描述性统计和回归表格,缺乏与算法框架的有机衔接。我们实验室在分析某大纲生成器时得出的体验是:表格本身只是中间产物,关键在于如何用文字将数据表“翻译”成对算法性能的论证。例如,在一项关于深度学习收敛速度的研究中,我们分析了420个技术企业的训练日志,发现当学习率从0.01降至0.001时,损失函数的下降曲线呈现明显的分段特征。此时,描述性统计表应突出均值与标准差的变化趋势,而非简单罗列数值。
具体到描述规范,我们建议遵循“变量定义→统计量选择→结果解读”的三步法。以回归分析为例,假设模型为 $y = \beta_0 + \beta_1 x + \epsilon$,其中 $y$ 表示算法准确率,$x$ 表示训练轮次。在SPSS输出中,应重点关注 $\beta_1$ 的显著性水平(p值)和调整R方,而非盲目复制整个ANOVA表。我们在测试中发现,许多论文的回归表格缺少对残差独立性的检验(如Durbin-Watson统计量),这可能导致伪回归问题。因此,在描述时需明确标注检验结果,例如“Durbin-Watson值为1.89,接近2,表明残差无自相关”。