在软件工程论文中,实证分析部分常因描述性统计与回归表格的枯燥堆砌而沦为“流水账”。我们实验室在分析某代码重构数据集时发现,规范的数据表描述应遵循“变量定义→统计特征→对比解读”的三段式结构。例如,针对代码行数(LOC)、圈复杂度(CC)和代码克隆率(CR)三个变量,描述性统计表需明确标注均值、标准差、最小值与最大值,并辅以文字说明:“样本中LOC的均值为1250行(SD=340),表明代码规模中等偏上;CC均值8.2(SD=2.1)暗示模块复杂度可控。”这种写法既避免了数字罗列,又为后续回归分析埋下伏笔。
回归表格的描述则需聚焦系数显著性、模型拟合度与假设验证。以我们处理过的420个开源项目样本为例,多元线性回归模型 $y = \beta_0 + \beta_1 \cdot LOC + \beta_2 \cdot CC + \epsilon$ 中,LOC的系数$\beta_1=0.032$(p<0.01)表明代码行数每增加1%,重构工作量上升0.032个单位。此时应避免直接复制表格数字,而是提炼关键发现:“LOC与重构工作量呈显著正相关,支持假设H1;而CC的系数不显著(p=0.12),说明圈复杂度并非主要驱动因素。”这种叙述将表格转化为逻辑论证,提升了论文的学术深度。