1. 为什么我们需要校准CHARLS的认知分数?
如果你用过CHARLS(中国健康与养老追踪调查)的数据,特别是研究认知功能变化,那你大概率踩过一个坑:不同波次(wave)的认知测试分数,好像不能直接拿来比。我刚开始用的时候也纳闷,明明是同一个人,怎么2011年测的和2015年测的分数,看起来像两套标准?这感觉就像你用一把刻度不准的尺子,今年量身高是175cm,明年用另一把尺子量,变成了178cm,你到底是长高了,还是尺子的问题?
问题的根源在于,CHARLS作为一个长期的追踪调查,为了适应研究需要和避免练习效应,在不同波次中调整了认知测试的题目、形式甚至计分方式。比如,有的波次用的是“即时回忆”和“延迟回忆”的词语列表,有的波次则加入了图形绘制等任务。这就导致原始分数(raw score)本身缺乏跨时间的可比性。直接使用这些原始分数进行纵向分析,比如研究认知衰退,结果很可能会被测量工具的差异所污染,导致我们误判了真实的认知变化轨迹。
之前,学界普遍采用一种叫做**加权等百分位等值法(Weighted Equipercentile Equating)**的方法来尝试解决这个问题。这个方法的核心思路很直观:它假设在不同波次中,如果两个人处于相同的能力百分位(比如都排在前10%),那么他们的“真实”认知水平应该是相当的。所以,它会找一个“基准波次”(比如Wave 3),然后建立其他波次分数与这个基准波次分数之间的转换关系。简单说,就是帮你把不同波次的分数,“翻译”到同一把尺子上。
这个方法由Wu等学者在2024年提出并应用,确实向前迈进了一大步,让跨波次比较成为可能。但是,它有一个很强的、甚至可能不太符合现实的前提假设:它默认不同波次的受访人群,在排除了测量工具差异后,其潜在的认知能力分布是相同的。换句话说,它假设2011年的60岁人群和2018年的60岁人群,如果教育水平等背景相似,他们的认知“底子”是一样的。这个假设忽略了老龄化过程中个体认知能力的自然衰退,也忽略了不同出生队列可能经历的不同历史环境对认知储备的影响。用个不太恰当的比喻,这就像假设2011年的智能手机和2023年的智能手机,只要价格档位相同,其核心性能就完全一样,而忽略了芯片技术的代际进步。
因此,当我们发现使用这种方法校准后,某些波次的认知分数均值反而比前一波次更高时,我们就需要警惕了:这到底是校准方法的问题,还是我们忽略了一些重要的分层因素?教育水平,就是其中一个被长期关注,但在跨波次等值中未被充分纳入考量的关键变量。
2. 教育分层:一个被忽视的校准关键
为什么教育水平如此重要?在认知老化研究中,这几乎是一个共识:更高的教育程度通常与更强的认知储备相关。这意味着,面对同样的认知老化速度,教育程度高的人可能表现出更平缓的下降曲线,或者在面对复杂认知任务时,有更强的“代偿”能力。
但在跨波次测试等值中,教育的影响是双重的:
- 直接影响答题表现:教育程度高的人,可能更擅长应对记忆测试、更理解测试指令,从而在相同潜在能力下获得更高的原始分数。
- 影响对测试形式变化的适应性:当测试题目或形式发生变化时(比如从简单的词语回忆变为更复杂的图形记忆),不同教育背景的人群受到的影响程度可能不同。高教育群体可能因为更强的学习能力和策略灵活性,更能适应新题型,从而在分数上表现出更小的波动。
传统的等百分位等值法,是将所有受访者“一视同仁”地进行分数转换。它隐含的假设是,测试形式变化对所有人的影响是均质的。但Chen & Donnell (2025) 的研究敏锐地指出,这个假设可能不成立。他们推测,高教育群体在面对更复杂的测试清单和更严格的测试条件时,可能具备更强的应对能力。因此,如果不区分教育水平,直接将所有人的分数放在一起进行等值,可能会系统性地高估低教育群体的认知水平,或低估高教育群体的认知衰退。
这就好比学校考试,一次用A卷,一次用B卷,B卷整体更难。如果不分学生水平,直接用总分排名去等值,那么那些擅长应对难题的尖子生(高教育)在B卷上的相对优势可能被低估,而基础薄弱的学生(低教育)在简单A卷上的相对劣势也可能被掩盖。Chen & Donnell (2025) 的新策略,核心就是要把“学生”按“基础水平”(教育程度)先分班,然后在不同的“班级”内部,分别进行试卷难度的等值调整。
3. 新策略详解:混合等值法如何运作?
Chen & Donnell (2025) 在《Social Science & Medicine》上提出的方法,我称之为 “分层的混合等值法” 。它不再是“一刀切”,而是“因材施教”,具体操作可以分为三步走:
3.1 第一步:按教育水平分层
首先,他们根据受访者自我报告的最高教育程度,将样本分为三个层次:
- 低教育组:文盲或未完成小学教育。
- 中教育组:完成小学但未完成高中教育。
- 高教育组:至少完成高中教育。
这个分层虽然简单,但抓住了影响认知测试表现的核心社会人口学变量。分层之后,所有的等值计算都将在各层内部独立进行。这意味着,一个低教育组里排名前10%的分数,只会与低教育组内部的基准进行比较和转换,而不会去和高教育组的前10%直接挂钩。
3.2 第二步:针对不同波次,选择不同的等值技术
这是该方法最精妙的地方,它没有固守一种等值方法,而是根据波次间测试形式的一致性程度,灵活选用两种主流技术:
-
频率估计法(Frequency Estimation Equating):适用于测试形式高度一致的波次。在CHARLS中,第1、2、3波以及第5波(针对即时回忆部分)的认知测试核心——词语列表回忆——保持了高度的一致性。对于这些波次,Chen & Donnell (2025) 采用了频率估计法。它的原理是利用一个“锚题”(anchor)或共同部分来估计两个测试总分的分布关系。在他们的处理中,他们实际上将整个测试视为一个整体,通过统计模型来估计不同波次间分数分布的对应关系,这种方法在连接形式相同的测试时更为稳健和精确。
-
等百分位等值法(Equipercentile Equating):适用于测试形式发生显著变化的波次。CHARLS的第4波次在认知测试上做了较大调整。对于这种“断裂式”的变化,频率估计法可能不再适用。此时,他们转而使用传统的等百分位等值法,直接在不同波次间寻找相同百分位排名所对应的分数。这种方法不依赖于测试内容的一致性,只依赖于分数分布的形态,更适合处理“突变”情况。
这种“混合”思路非常务实。它承认了数据收集现实:有些波次间可比性强,有些则弱。不强求用一种方法解决所有问题,而是根据数据特征选择最合适的工具。
3.3 第三步:分层混合等值的具体计算与实现
听起来可能有点抽象,我来举个具体的例子,并展示一下他们提供的部分Stata代码逻辑,让大家感受一下这个“分层校准”是怎么落地的。
假设我们要将低教育组的Wave 1的原始分数(r1tr20)校准到Wave 5的尺度上。
首先,判断Wave 1和Wave 5的测试形式是否一致?是的,它们的即时回忆测试核心是一致的。因此,对低教育组,我们使用频率估计法来建立Wave 1到Wave 5的转换关系。研究者通过模型估计出了一张转换表。例如,原始数据中,一个低教育受访者在Wave 1的即时回忆测试中得了0分(r1tr20==0),那么根据频率估计模型,他被校准后的分数是-0.5分(这可能是为了保留小数位和区分度,并映射到一个连续的尺度上)。
我们在Stata中看到的代码片段是这样的:
* Wave1 - 低教育组校准
gen r1tr20b = . // 新建一个变量存放校准后的分数
replace r1tr20b = -0.5 if r1tr20 == 0 & raeduc_c <= 3 & !mi(raeduc_c)
replace r1tr20b = 0.27 if r1tr20 == 1 & raeduc_c <= 3 & !mi(raeduc_c)
replace r1tr20b = 1.64 if r1tr20 == 2 & raeduc_c <= 3 & !mi(raeduc_c)
// ... 以此类推,为0-20分的每一个原始分数都赋予一个校准后的值
这里的 raeduc_c <= 3 就是筛选低教育组(根据他们的编码,1-3代表低教育)。r1tr20b 就是校准后的新分数。
而对于Wave 4,由于测试形式变化大,他们对所有教育组都采用了等百分位等值法。例如,对于低教育组,Wave 4原始分0分对应校准分0.62,原始分1分对应3.13,等等。代码结构类似,但背后的计算逻辑是基于分布形态的匹配。
* Wave4 - 低教育组校准
gen r4tr20b = .
replace r4tr20b = 0.62 if r4tr20 == 0 & raeduc_c <= 3 & !mi(raeduc_c)
replace r4tr20b = 3.13 if r4tr20 == 1 & raeduc_c <= 3 & !mi(raeduc_c)
// ... 后续分数对应关系
关键点在于:高教育组和中教育组有自己独立的一套转换表。同样是Wave 1原始分0分,在高教育组,校准后的分数可能就不是-0.5了。这就实现了“分层校准”。
4. 新旧方案对比:数据可视化的震撼效果
理论说再多,不如直接看图。Chen & Donnell (2025) 在论文中提供了非常直观的核密度估计图,对比了原始分数、Wu et al. (2024) 的全局等值法、以及他们提出的分层混合等值法在不同波次上的效果。
我们虽然没有原图,但可以描述一下那种震撼的差异:
- 原始分数:Wave 3和Wave 4的认知分数分布曲线(比如核密度估计的峰值和形状)存在明显偏移。Wave 4的分布整体可能更靠左(分数偏低)或形状不同,这直接反映了测试变化带来的“测量噪音”。
- Wu et al. (2024) 全局等值法:应用后,Wave 3和Wave 4的分布曲线被拉近了很多,大部分重叠。这说明等值法有效消除了主要的测量差异,使得跨波次比较成为可能。这是巨大的进步。
- Chen & Donnell (2025) 分层混合等值法:曲线重叠得更加完美。特别是分布的中部和高分尾部,两条曲线几乎严丝合缝。这意味着,在考虑了教育水平的调节作用后,校准的精度得到了进一步提升。更值得注意的是,在一些细节上,比如分布的偏度(skewness)或峰度(kurtosis),新方法校准后的波次间一致性也更好。
这种视觉上的改善,背后有着深刻的含义。它表明,单纯进行全局等值,可能只是“平均地”校正了误差,而分层等值则进一步消除了与教育水平相关的系统性偏差。对于研究认知衰退轨迹,尤其是关注不同社会经济地位群体差异的研究者来说,这种更精细的校准意味着更可靠的结论。你不再需要担心观察到的“低教育群体认知衰退更快”这一现象,有一部分其实是源于他们更不适应测试形式变化而导致的测量误差。
5. 新策略的优势与潜在局限
用了这个方法一段时间,并结合文献,我总结了它的几个核心优势:
- 更符合认知老化的理论:明确承认并建模了教育作为认知储备关键因素的作用,使校准过程具有更强的理论依据。
- 更高的校准精度:如上文可视化对比所示,它能更有效地消除波次间的测量非一致性,特别是减少了因忽略群体异质性而产生的偏差。
- 提升纵向分析的有效性:对于研究认知轨迹、识别风险因素、评估干预效果等纵向研究,更干净的测量等于更强大的统计效力(statistical power)和更小的第一类错误(发现虚假关联)风险。
- 方法上的灵活性:混合使用频率估计和等百分位等值,体现了对现实数据复杂性的尊重,为处理其他追踪调查中类似的“部分变化、部分稳定”的测量问题提供了思路。
当然,作者自己也坦诚了方法的局限性,我们在应用时也必须心里有数:
- 对“锚”的依赖:频率估计法依赖于波次间存在稳定的、可比的测量部分。如果这个“锚”本身也不稳定,那么校准的根基就会动摇。
- 教育分层的粗糙性:仅用最高教育程度分成三组,可能仍然过于粗糙。教育质量、专业背景、终身学习等维度未被纳入。未来可以考虑更精细的分层或使用连续变量建模。
- 未控制其他混淆因素:该方法主要聚焦于教育,但年龄、性别、健康状态、调查环境等因素也可能影响测试表现及对测试变化的适应性。这些因素与教育可能存在交互作用。
- 经典测量理论的框架:该方法仍基于经典测量理论(CTT)。CTT在分数接近量表上下限时(天花板/地板效应)可能存在局限。未来与项目反应理论(IRT)或Rasch模型等现代测量理论结合,可能会产生更稳健的校准分数,尤其是处理题目顺序效应、题目功能差异(DIF)等问题时。
6. 实操指南:如何在你的研究中使用这套新校准分数?
如果你已经心动,想在自己的CHARLS认知研究中应用这套目前看来更优的校准分数,可以按以下步骤操作:
- 获取校准代码与转换表:关注Chen & Donnell (2025) 论文的补充材料或相关数据共享平台(如GitHub)。他们通常会提供完整的Stata或R代码,以及生成好的校准分数变量。上文给出的代码片段就是一个示例,但完整的版本包含所有波次、所有教育组的所有分数映射。
- 数据准备:确保你的CHARLS数据中包含了必要的原始认知分数变量(如
r1tr20,r2tr20, ...r5tr20代表各波次即时回忆总分)和教育程度变量(如raeduc_c,需确认其分类与论文一致)。 - 运行校准程序:在Stata中,将提供的do文件与你的数据结合运行。代码会依据教育分层和波次,为每个受访者的每个波次认知分数生成一个新的校准后变量(如
r1tr20b,r2tr20b等)。 - 替换与分析:在你的分析模型中,使用新生成的
*tr20b系列变量替代原始的*tr20变量。这些新变量已经是在同一尺度上可比的分数了。 - 敏感性分析:一个严谨的做法是,用新旧两种校准分数(Wu et al. 2024 和 Chen & Donnell 2025)分别运行你的核心分析模型,比较结果是否存在实质性差异。如果关键结论保持一致,那你的发现就更稳健;如果出现差异,则需要深入探讨这种差异是否源于教育分层带来的校准改进。
注意:校准主要针对的是“即时回忆”和“延迟回忆”的词语列表任务分数。对于CHARLS中的其他认知模块(如数字能力、绘图等),可能需要不同的处理或暂时仍使用原始分数,需仔细阅读原论文的方法部分。
7. 给研究者的建议与未来展望
从我个人的使用经验来看,这套分层混合等值法确实是目前处理CHARLS跨波次认知分数最精细、理论依据更充分的方案。特别是当你研究的问题涉及教育、社会经济地位等与认知储备密切相关的变量时,使用这套校准分数能让你对结果更有信心。
不过,没有任何方法是银弹。我建议:
- 明确你的研究问题:如果你的研究核心就是教育不平等与认知老化,那么必须使用这种分层校准方法。如果只是将教育作为控制变量,使用Wu et al. (2024) 的全局校准法可能也足够,但进行敏感性分析对比一下总是好的。
- 关注方法发展:测量等值是一个活跃的研究领域。未来可能会有更复杂的模型出现,例如同时考虑年龄、性别、教育等多变量的分层等值,或者直接基于IRT模型进行校准。保持关注。
- 理解你的数据:在使用任何校准分数前,花点时间描述性统计一下校准前后分数的分布变化、与关键变量的相关性变化。这能帮你直观感受校准带来的影响。
- 透明报告:在论文的方法部分,务必清晰说明你使用了哪种认知分数校准方案,并引用相应的文献(Chen & Donnell, 2025)。这是研究可重复性的基本要求。
最后,我想说的是,CHARLS这类宝贵的纵贯数据,其价值就在于能让我们观察随时间的变化。而测量工具的变化是这种观察的“阿喀琉斯之踵”。像Chen & Donnell (2025) 这样的工作,正是在为我们锻造更精准的“尺子”。用好这把尺子,我们才能更清晰地描绘出中国老年人认知老化的真实图景,为相关政策和干预提供更坚实的证据。

154

被折叠的 条评论
为什么被折叠?



