行为科学
大型语言模型复制人类决策偏差:比调查更有效的路径选择研究
一项使用3000个GPT-5智能体在路径选择实验中的研究表明,大型语言模型以高保真度再现了累积前景理论的偏差,包括损失厌恶、参考依赖和概率权重。该方法绕过了传统行为建模中参数估计的瓶颈。

几十年来,模拟真实人类在风险和不确定性下的决策一直面临实际难题。累积前景理论(CPT)捕捉到经典经济学忽视的偏差:损失厌恶、参考依赖、以及高估极小概率的倾向。但大规模应用CPT需要个体层面的参数,而这些参数获取成本高昂。调查样本小,控制实验异质性有限。人类决策的多样性仍然难以企及。
天津大学与宁波诺丁汉大学的研究团队现在发表了一项可能是首次系统性论证,表明大型语言模型能够完全绕过这一瓶颈。在题为“使用大型语言模型重现路径选择中的人类偏差”的预印本中,研究人员表明,3000个基于LLM的智能体,每个具有不同的人口统计和心理特征,产生的选择模式与CPT预测高度吻合,增益情境下的拟合优度超过0.93,损失情境下超过0.95。
“这些发现表明,生成式人工智能模型可能为模拟人类决策过程提供可扩展的替代方案,”作者写道。这意味着,长期受限于无法赋予虚拟智能体真实行为异质性的基于智能体的模拟,现在可以达到以往仅限小规模人类受试者实验的保真度。
从问卷调查到生成式智能体
论文所指的瓶颈不是理论性的,而是操作性的。CPT通过价值函数和概率权重函数描述选择行为,这些函数由参数控制,这些参数编码了人对收益与损失的敏感度、概率差异的折扣程度以及心理参考点的设定。传统上,估计这些参数意味着最多对几百名参与者进行调查,例如华盛顿地区出行调查中的160份有效记录,或实验室实验中的少数研究生。所得参数集描述的是群体平均值,而非真实世界的异质性谱系。
中国团队的方法是用基于LLM的智能体取代人类受试者。他们采用非参数提示架构,创建了十个智能体档案:退休工人去医院、快递员送货、视频博主评价地点等, , 每个都有明确的风险偏好、时间敏感度和出行目的。每个档案生成300个智能体,总共3000个虚拟受试者。这些智能体面对路径选择场景,其中相同的平均出行时间隐藏着不同的风险分布:有些路径结果稳定但平庸,有些则提供大幅增益的可能,同时伴随真实损失风险。
“通过标准化提示,基于LLM构建了具有多维属性的异质性人类智能体,”作者解释道。智能体并未接收CPT参数,而是接收了关于其身份和偏好的描述,并被要求选择路径。
LLM 复现的偏差
论文测试了两个经典的CPT预测。第一,人在收益领域是风险厌恶的,在损失领域是风险寻求的。第二,这种不对称并非对称:损失带来的痛苦大约是等量收益带来的愉悦的1.43倍, , 这一数值直接来自LLM生成的选择。估计的参数:α=0.4(收益敏感性)、β=0.64(损失敏感性)、λ=1.43(损失厌恶),处于人类研究报告的数值范围内。
关键的是,智能体并非机械地遵循其风险标签。当类型1智能体(被描述为谨慎细致的退休工人)处于损失情境,且路径A准时到达概率为零时,他们转向了波动性更大的路径B。“这表明,尽管他们通常风险厌恶,但在无法避免迟到时会重新评估结果分布,”作者指出。被描述为风险寻求的视频博主和大学生档案主要选择高方差路径,但并非在所有场景中均匀一致,表明其决策具有情境依赖性,而非固定策略。
研究还从智能体的预期出行时间中提取了参考点, , 即衡量收益与损失的心理基准。LLM智能体各自形成了个性化预期,而非施加固定参考点;所有这些预期的聚合产生了随场景变化的参考点,反映了行为经济学家在人类受试者中观察到的相同情境依赖。
扩展行为规模而不增加成本
这一方法的实际前景不仅在于其有效性,更在于其低成本。让3000名人类受试者重复经历11个场景三次,在招募成本和时间上都极为昂贵。而基于LLM的模拟生成了可直接用于统计分析的结构化JSON输出,除提示设计外几乎无需人工监督。
作者明确指出了未证明的内容。他们的研究并未测试LLM能否重现所有已知行为偏差,仅测试了路径选择背景下的CPT相关偏差。智能体档案虽多样化,但仍是多样性的模拟,而非针对真实人口数据的验证。此外,使用单一模型GPT-5,也留下了结果是否能在不同模型家族或温度设置下泛化的疑问。
尽管如此,该论文为行为建模者多年来努力突破的方向打开了大门。如果LLM能够生成准确反映人类偏差结构的合成行为数据,那么瓶颈将从数据收集转移到提示工程, , 这一约束至少在理论上更容易扩展。
生成式行为建模的未来道路
天津大学团队的工作契合了更广泛的趋势,即使用LLM作为某些研究者所说的“计算社会科学黑盒”。斯坦福大学生成式智能体项目的前期研究表明,基于LLM的智能体能够在沙盒环境中模拟信息扩散和社会聚合。本文将该逻辑扩展到一个严格参数化的行为框架,暗示相同的智能体可以作为人类受试者的替代品,用于测量特定认知模式的实验。
下一个问题, , 论文未回答, , 是LLM智能体估计的参数是否与同一场景中真实人类行为估计的参数相匹配。该研究止步于证明智能体的选择与CPT一致,未将所得参数估计值与人类收集的基线进行比较。这一比较自然是下一步工作,作者在总结中间接承认:“未来研究应考察不同人工智能模型与现实世界用户决策的比较。”
对于交通建模、城市规划以及基于智能体模拟的实践者,该论文提供了具体方法。标准化提示架构是模块化的:相同的档案和规划组件可以适应模式选择、出发时间甚至金融决策场景。代码和提示模板尚未公开发布,但论文提供了足够详细的细节来复现该方法。
如果研究结果在跨领域和模型中成立,那么长期约束行为建模的瓶颈可能终于有了解决方案, , 一个通过API调用运行而非依靠纸笔的解决方案。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。