法学论文中,实证分析部分常沦为“数据堆砌”。许多学生在跑完SPSS或Stata后,直接复制表格,再用“如表所示,X与Y显著相关”一笔带过。这种写法既缺乏深度,也容易被审稿人质疑。我们实验室在分析某法学院2023年提交的120篇实证论文时发现,超过70%的描述性统计部分仅列出均值与标准差,未对数据分布、异常值或变量间初步关系做任何说明。例如,一篇研究“法官性别对量刑轻重影响”的论文,其描述性统计表只给出了男女法官的判刑年限均值,却未报告方差齐性检验结果,导致后续回归分析的可信度大打折扣。
解决这一问题的关键在于:将数据表视为论证的起点而非终点。描述性统计应揭示数据的基本特征,为后续模型选择提供依据。例如,若因变量为二分类(如是否判缓刑),则需在描述部分说明样本中缓刑比例,并检验自变量是否存在多重共线性。我们建议在正文中嵌入类似“$VIF_j = \frac{1}{1-R_j^2}$”的公式,解释方差膨胀因子的计算逻辑,而非仅给出数值。
以我们团队处理过的一个真实案例为例:某研究收集了420家科技企业的专利诉讼数据,因变量为“诉讼结果(胜诉/败诉)”,自变量包括“企业规模(员工数)”、“专利数量”、“法务团队人数”等。在描述性统计部分,我们不仅报告了各变量的均值、标准差、最小最大值,还绘制了箱线图以识别异常值(如某企业法务团队人数达200人,远超均值5人),并在正文中说明剔除该异常值后的稳健性检验结果。这种处理方式使审稿人明确感知到数据清洗的严谨性。