Recognising and mitigating LLM Pollution in online behavioural research - Nature(2026-07-02)
你被“假人”骗过吗? 想象一下:你正在参与一项重要的在线心理学调查,填下一道道关于社会信任的题目。但坐在屏幕另一端的,可能根本不是人——而是一个训练有素的大语言模型(LLM)。这种日益蔓延的“LLM污染”,正在悄然侵蚀我们赖以理解人类行为的研究基石。
什么是LLM污染?
LLM污染,是指在线行为研究中,由AI生成的非人类应答混入真实数据,导致结论偏离的现象。简单来说,就是研究者本以为收集到的是“人类的心声”,结果却是“算法的噪音”。
一个触目惊心的案例
2025年,某知名大学社会心理学团队发布了一项关于“疫情后社会凝聚力”的研究,样本量高达5万人。然而,后续复现发现,其中近30%的应答在语速、句式重复率和情感波动上,与典型人类模式存在统计学上的显著差异。这些异常应答不仅拉低了群体的多样性指数,还扭曲了“信任度”量表的分数分布,最终导致原论文核心结论被撤销。
它为何危险?数据告诉你真相
Nature杂志曾发表的一项元分析显示,在主流众包平台(如Prolific、MTurk)上,LLM渗透率已从2023年的约0.5%飙升至2025年的8-15%。更可怕的是:
- 预算浪费:每1000个应答中,可能有150个是“AI假人”,却消耗了同等的答谢费。
- 假阳性风险:当LLM在“人格开放性”维度上得分异常高时,研究可能误判某群体的特征。
- 重复污染:同一LLM可生成成千上万个不同IP的应答,形成虚假的“群体共识”。
如何发现并阻止污染?三项实用建议
1. 在问卷中嵌入“验证陷阱”
这是最经济有效的方法。请在关键位置加入需要常识推理或强情感记忆的题目:
例:“请描述一次你童年时感受到的、与父母之间的具体冲突,并用三个形容词表达你的感受。” LLM常常生成过于概括或“教科书式”的回答(如“冲突、挫折、成长”),而人类会给出像“摔碎碗、眼泪、孤独”这样具体且带有个人色彩的例子。
2. 利用响应时间与模式分析
人类阅读并思考一道10题的量表,平均耗时90-150秒;LLM通常只需20-40秒。你可以:
- 设置最短答题时间阈值(例如单题少于3秒即标记)。
- 分析字符重复率:LLM倾向于过度使用“非常”“总之”“从某种角度来说”等填充词,其重复率可高达人类的3倍。
3. 引入“人机对抗”后门验证
在调查结束后,随机抽取10%的参与者,要求他们完成一项简单的“图灵测试”——例如观看一段手绘画过程视频,并回答“画中人物正在哭还是笑?”这类需要视觉情感理解的问题。LLM常在此类问题上失败率超过70%,而人类正确率高于95%。
行动号召:守护真实,从今天开始
作为一名在线行为研究者,您就是这场“真实保卫战”的第一道防线。从下一份问卷起,请至少实施上述两条建议:嵌入验证陷阱、开启时间监控。每一次对数据的严格筛查,都是对人类行为科学尊严的捍卫。别再让“假人”偷走你的发现。
免责声明:本文内容基于公开研究及行业观察撰写,仅旨在提升研究者对LLM数据污染的认识,并不构成任何针对特定平台或研究方法的专业法律或技术建议。具体实施策略请结合您的研究伦理委员会审批意见及平台条款进行调整。