让大模型模拟投资者之前,先审计它是否真的像投资者
一项纸上交易研究提醒投资团队:大模型能写出像样的交易故事,但在代表真实决策前,必须先通过行为保真度审计。
评估“大模型投资者模拟器”时,真正的问题不是它能不能写出一笔听起来合理的交易,而是它能不能在当时可见的信息范围内,复现一个真实投资者的决策过程。2026年9月一篇发表在 arXiv 的研究把这个问题变成了可测量的工作:研究者用80名参与者、1239个对齐的用户日,做了纵向纸上交易实验。结果显示,没有一个受测大模型能稳定超过“延续近期交易状态”这一简单基线,去预测参与者是否会交易。任务进一步细化到买卖方向、资产选择和组合结果时,保真度还会下降。
这并不意味着模拟没有价值,而是改变了它在投资流程中的位置。团队可以用大模型生成行为假设和压力场景,但在把它当作投资者代理之前,必须先做行为保真度审计。会说出“像投资者”的话,不等于真的模拟了这个投资者。
从编写投资者画像,转向检验行为保真度
旧流程通常是:描述一个投资者的偏好,把市场背景交给大模型,再问它这个人可能会怎么做。新流程把模拟器当作需要验证的测量工具。系统只能看到决策日前已经存在的信息,预测下一步行为,再与参与者随后在纸上交易中的实际行为比较。
研究采用滚动的次日预测设计,这一点很关键。用户互动、模拟交易、虚拟组合状态和当时可见的市场信息被放在同一个时间边界内,模型不能偷看未来。评估也分层进行:先看是否交易,再看动作结构、资产选择,最后看组合轨迹。因为“是否交易”相似,并不代表模拟出来的组合会走向同一个地方。
对研究团队而言,产物因此不再是一段有说服力的投资者画像,也不是一个孤立的命中率,而是一份带日期的预测记录,里面必须有证据、置信度和失败原因。
一套可以复现的审计流程
先准备纸上交易或历史重放数据:时间戳、当时可见的信息、组合状态和下一步实际动作都要保留。锁定信息边界。每个决策日只向模拟器提供此前已经出现的记录和文件,并要求结构化输出:是否交易、买卖或持有、资产、置信度、使用的证据以及不作答的原因。
比较模型前,先跑三条基线:
- 延续基线: 复制参与者近期的交易状态。
- 总体比例基线: 预测评估窗口中最常见的动作。
- 透明规则或人工基线: 在相同信息边界内运行一条可解释规则。
分层统计结果。交易发生与否可以看平衡准确率或校准度;动作结构可以看 macro-F1;资产选择可以看 top-k 重合率或排序指标;组合层面则看轨迹差异。最后一个指标不是收益率,也不能被包装成投资建议,它只表示行为相似程度。
研究还发现,近期交易历史对“会不会交易”的预测影响很大,而资产选择对可用证据更敏感。这提示一种更稳妥的系统设计:让模型整理和质询证据,但把最终的行为标签绑定到可审计记录上。论文还观察到,针对某个股票代码的研究活动与即将发生的交易有关,但诊断结果不支持因果解释。相关性不能直接变成投资意图。
这与智能交易证据账本的工作流相呼应:把主张和来源分开;也延续了本系列关于更强模型可能带来更高相关性的讨论。模拟器还可能制造另一种共同失败:许多看似不同的代理,被压缩成同一个方便却失真的投资故事。
一个60分钟的研究练习
准备20到50个带日期的纸上交易决策,或一个可以重放的公开数据集。按时间切分,前70%作为基线窗口,后30%作为观察窗口。对每个观察日,在相同的信息截止点下比较延续模型、透明规则和一个大模型提示。记录交易发生、动作类型、资产选择、置信度、证据引用和拒答情况。
基线就是延续模型。指标包括交易活动的平衡准确率、动作类型的 macro-F1、top-k 资产重合率、校准误差,以及输出引用截止时间之后信息的比例。若无法核验时间戳、样本太小而无法估计不确定性,或模型开始输出个性化金融建议,就停止练习。所有结果只保存在研究日志中,不下单,也不据此判断任何人的适当性。
证据的边界
这是一篇正在审稿的预印本,不足以证明所有大模型模拟器都失败,也不足以证明人的行为稳定不变。参与者、市场时期、提示设计和纸上交易环境都会带来选择偏差与测量偏差。研究中的观察性关系不能证明因果。若只保留完整、容易记录的决策,还会有幸存者偏差和报告偏差。模型也可能学到数据记录方式,而不是投资者的推理机制。
因此,核心判断应当保持窄而明确:在用大模型压力测试组合流程之前,必须逐层验证它复现了什么,并与简单基线比较。投资流程真正改变的不是“问AI投资者会怎么做”,而是“先测量这个模拟器是否配得上代表投资者”。
来源:He等,《Are LLMs Good Financial User Simulators?》;Pozniak等,《Why Better Models Can Create Riskier Systems》。