在人工智能研究中,问卷数据的质量直接决定模型训练和特征提取的有效性。我们实验室在分析某智能教育平台用户行为时,曾因量表设计不当导致回收的420份样本中近30%无法使用。以下是我们总结的规范流程:
首先,明确构念定义。例如,研究“AI工具使用意愿”时,需参考TAM模型,将“感知易用性”和“感知有用性”作为潜变量。每个潜变量至少设计3-5个题项,采用李克特7点量表。我们在测试中发现,题项表述需避免双重否定和引导性语言,否则信度会显著下降。
其次,预测试与项目分析。收集50-100份预试样本,计算每个题项的“校正后项目-总体相关系数”(CITC),剔除CITC低于0.3的题项。例如,某题项“我认为AI工具很复杂”的CITC仅为0.21,删除后整体克隆巴赫系数从0.72提升至0.81。
最后,正式施测的样本量要求。根据经验法则,样本量至少为题项数的10倍,且不低于200。对于结构方程模型,建议样本量在300-500之间。我们曾对比不同样本量下的信度稳定性,发现当样本量从200增至400时,克隆巴赫系数的置信区间收窄约40%。