在中国文学论文中引入实证分析,常面临数据表与文本细读脱节的问题。我们实验室在分析某大纲生成器时得出的体验是:许多学生跑完SPSS或Stata后,直接复制表格到论文中,却缺乏对统计量含义的阐释。例如,描述性统计表应包含均值、标准差、偏度、峰度等指标,但需结合文学文本特征说明其意义。以某次对420篇明清小说叙事结构的量化分析为例,我们计算了叙事视角转换频率的均值($\bar{x}=3.42$)和标准差($s=1.87$),并指出偏度($0.65$)表明数据右偏,即多数作品视角转换较少,但少数作品频繁转换,这与文学史中“白话小说叙事革新”的论断相符。
回归分析表格的描述更需谨慎。标准格式应包含回归系数($\beta$)、标准误($SE$)、t值(或z值)、p值,以及模型拟合指标(如$R^2$、调整$R^2$、F值)。例如,在分析“科举制度对明清小说中士人形象塑造的影响”时,我们构建了多元线性回归模型:$y = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \epsilon$,其中$y$为士人形象正面指数,$x_1$为科举相关情节占比,$x_2$为作者科举经历。结果显示$x_1$的系数$\beta_1=0.32$($p<0.01$),表明科举情节每增加一个单位,士人形象正面指数平均提高0.32个单位。描述时需避免流水账,应逐项解释系数的文学含义,而非罗列数字。