在软件工程研究中,问卷是收集数据的重要手段。我们实验室在分析某代码重构工具的用户接受度时,发现许多回收的问卷因设计缺陷而无法使用。例如,某研究团队针对300名开发者发放问卷,回收后信度检验显示克隆巴赫系数仅为0.45,远低于0.7的阈值。问题根源在于量表题项表述模糊,且未进行预测试。我们总结出一套规范流程:首先,基于理论模型(如技术接受模型TAM)构建初始题项;其次,邀请5-8名专家进行内容效度评估;最后,对30-50名样本进行预测试,计算克隆巴赫系数。若系数低于0.7,需删除或修改题项。例如,我们在一项关于持续集成工具的研究中,初始量表含20题,预测试后删除4题,最终系数达到0.82。
样本量要求方面,根据经验法则,问卷题项数与样本量之比至少为1:10。例如,若量表含30题,则至少需要300份有效问卷。我们曾分析420家科技企业的数据,发现样本量不足会导致信度估计偏差。此外,问卷设计需避免引导性语言,采用李克特5点或7点量表。例如,题项“我认为代码重构工具易于使用”比“您是否同意代码重构工具易于使用?”更规范。我们建议在正式发放前,进行小规模测试,并计算克隆巴赫系数:$\alpha = \frac{k}{k-1} \left(1 - \frac{\sum_{i=1}^k \sigma_{Y_i}^2}{\sigma_X^2}\right)$,其中k为题项数,$\sigma_{Y_i}^2$为第i题方差,$\sigma_X^2$为总分方差。