文章主要内容总结
该研究聚焦前沿大语言模型(LLMs)作为社会智能体时的角色条件保真度,核心探究模型在不同社会经济地位(SES)角色设定下,面对认知负荷任务(SAT数学题)与低认知负荷任务(情感偏好题)时的表现差异,揭示了“语境崩塌”(contextual collapse)现象及模型的“双面性”特征。
-
研究设计:选取GPT-5、Claude Sonnet 4.5、Gemini 2.5 Flash三款2025年前沿模型,设计15种社会经济角色(低/中/高SES)及3种测试场景(最优、中等压力、挑战),通过两类任务展开评估:
- SAT数学题(高认知负荷,单一正确答案,需优化准确性);
- 情感偏好题(低认知负荷,主观多元答案,可表达角色差异)。
- 补充:对Claude Sonnet 4.5进行扩展复现,使用45种角色和54道SAT题以验证结果稳健性。
-
核心发现:
- 认知负荷下的语境崩塌:GPT-5完全崩塌(所有角色表现一致,PERMANOVA p=1.000),Gemini 2.5 Flash部分崩塌(p=0.120),仅Claude Sonnet 4.5保留有限但可测量的角色差异(p<0.001),但呈现反常识模式——低SES角色表现优于高SES角色。
- 低认知负荷下的角色保真:所有模型在情感偏好题中均展现显著的SES相关差异(平均效应量d=0.52-0.58),尤其在风险容忍、时间偏好、大学选择等维度。
订阅专栏 解锁全文

1403

被折叠的 条评论
为什么被折叠?



