学术动态
学术动态
位置: 学术动态
中国基础教育质量监测协同创新中心陈平团队在Psychological Methods发文提出基于人工神经网络的心理测量缺失数据插补新方法
发布时间:2026-09-01     浏览次数:

近日,北京师范大学中国基础教育质量监测协同创新中心陈平团队在美国心理学会(APA)旗下的心理学方法Psychological Methods5-year IF: 11.5,中科院一区 Top在线发表题为Columnwise Neural Imputation for Incomplete Ordinal Psychometric Data的研究论文。北京师范大学张龙飞博士(现为浙江师范大学心理学院教师)为论文第一作者,美国加州大学洛杉矶分校 Minjeong Jeon 教授为第二作者,陈平教授为通讯作者。该研究得到国家自然科学基金面上项目(基金号:32071092)和北京师范大学中国基础教育质量监测协同创新中心规划类课题(课题号:2025-01-082-BZK01)的资助。

缺失作答在心理测验与教育测评中广泛存在。简单删除不完整样本或以题目均值、众数等简易规则填补缺失,不仅会损失信息,还可能扭曲题目均值、题目间相关及测量模型参数,进而给测验解释与后续决策带来偏差。对于Likert等级计分数据,插补方法还须兼顾反应类别的顺序性、题目间的复杂依赖关系以及缺失值的不确定性等因素。因此,如何在补全数据的同时保持其心理测量结构,是本研究关注的核心问题。为此,本文提出一种基于人工神经网络的缺失数据多重插补方案——序列神经插补(COLumnwise Neural Imputation, COLNI)。该方法依次将每道题目设为目标列,利用其余题目的作答模式作为预测信息,通过神经网络学习题目间关系,为目标列中的缺失作答生成多个合理插补值。如此逐列推进,直至所有题目均被处理,最终获得多份补全数据集。后续基于这些数据集进行参数估计,并依据多重插补规则合并结果(方法流程如图1所示)。

Figure 1_COLNI

1  COLNI方法示意图

COLNI核心组件包含:

1.        补偿器(Compensator)层:本文开发的一种新网络层,用于对缺失输入进行掩码与缩放处理,使得缺失程度不同的作答模式保持相对可比,无需预先进行均值填补;

2.        隐藏层:从观测作答中学习题目之间存在的复杂、非线性依赖关系;

3.        一致性排序LogitCORAL)输出层:将Likert反应类别的顺序信息嵌入网络结构,以使反应的累积概率保持单调;

4.        多重插补机制:借助Dropout层引入随机性,并结合Logit空间近邻采样(Logit-Space Nearest-Neighbor Sampling)为每个缺失生成多个合理插补值,从而获得多份完整数据集;最终依据Rubin法则合并各数据集上的参数估计结果。

本研究综合考虑两种缺失机制(完全随机缺失[MCAR]与非随机缺失[MNAR])、两种缺失率(10%30%)以及两种潜在特质结构(单维与三维),将COLNI与四种不同复杂程度的插补方法(简单的单次插补基线方法[CIM]基于随机森林的机器学习插补器[missForest]、基于人工神经网络的多重插补基准方法[MIDAS]和专为有序数据设计的多重插补方法[MICE-POLR])进行全面比较。模拟研究的结果(如图2所示)表明:在MCAR条件下,COLNIMICE-POLR的整体表现相近,并优于其余三种方法;在MNAR条件下,COLNI在题目均值、相关结构及多维等级反应模型(MGRM)参数返真方面总体最优,且这一优势在高缺失率和多维结构的情境下尤为突出。

Figure 2+3

不同缺失机制下的参数估计表现:COLNI兼具低偏差与低误差

研究进一步使用短式黑暗三联征量表(SD3)的实证数据进行检验。该量表包含275级计分题目,测量马基雅维利主义、自恋和精神病态三种人格特质。在约30%MNAR缺失条件下,COLNI插补后数据所得的题目均值、相关系数与MGRM参数估计均与完整数据结果高度一致(如图3所示);同时,有序阈值结构得到良好保持,多数完整数据下的参数估计值也都落入相应的多重插补置信区间内。

Figure 4

真实人格测验数据验证:COLNI插补结果与完整数据高度一致

总之,在多重插补框架下,COLNI充分发挥了神经网络的非线性表征能力,并融入等级反应的有序性约束,为测验等级计分数据中的缺失问题提供了一种灵活而高效的处理方案。其重点不在于简单“填满”数据矩阵,而在于尽可能保护原始数据的题目间关系与测量模型结构,从而为后续统计推断提供更可靠的数据基础。需要指出的是,本文结果反映的是既定模拟条件与实证设计下的表现,并不意味着COLNI能够无条件应对所有MNAR机制。未来仍需在纵向数据、其他变量类型及参数估计不确定性的量化等方面开展进一步探索。

 

正文链接https://doi.org/10.1037/met0000867

补充材料链接:https://doi.org/10.1037/met0000867.supp

代码链接:https://doi.org/10.17605/osf.io/c6rxa