模型更强,投资研究未必更分散

一项新的金融市场模拟提醒研究团队:更强的模型可能共享同一种错误,因此系统需要审计相关性。

两条人工智能研究路径汇聚到同一个市场风险节点,旁边是可审计的人工作业轨迹

人工智能投资研究的下一个失误,未必来自某一个模型判断错误。更值得警惕的是,工作流里的所有模型都以同一个方向犯错。

2026年9月的一篇预印本《Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets》,用基于智能体的市场模拟研究了这个问题。它给投资数据团队的核心提醒是:单个模型能力提高,可能同时提高各智能体行为之间的相关性。当它们共享推理方式,又接触同一套错误信息时,看似多元的系统可能收敛为一个无法分散的错误。

这会改变研究流程。模型评估不能只看准确率、校准度,或一份研究备忘录写得是否完整。更重要的问题是:几个智能体阅读相同财报、使用相似提示词,或继承同一次模型更新后,它们的结论到底有多独立?实际做法应是在组合和决策测试之间加入“相关性审计”。

这篇论文并没有证明所有生产系统都会如此。它研究的是智能体模拟,作者也明确把其他领域的推广留作开放问题。但背后的机制很现实:共同训练数据、共同检索服务、共同供应商和共同新闻源,都可能带来共同动作。市场里,共同的正确判断可能减少噪声;共同的错误前提却可能放大风险。因此,更强的模型可以让平均分析员变好,却让整个系统更脆弱。

对投资研究而言,改变是具体的。不要只让三个智能体各写一份意见,然后把一致当作独立验证。应先冻结信息截止时间,再改变资料来源、提示词、模型家族和推理约束;在智能体互相看到结果之前,保存每一条主张。需要比较的不只是结论是否一致,还要比较它们是否在缺乏证据时共同自信。分歧不必然有价值,共识也不等于证据。

一条可审计的流程可以包括:

  1. 固定时点的文件集合和带时间戳的检索记录;
  2. 隔离上下文的模型运行,以及完整的版本记录;
  3. 每条主张的证据链接、置信度和明确的“不知道”选项;
  4. 针对主张的相关性矩阵,而不只是比较最终组合权重;
  5. 对资料延迟、缺失、矛盾或被污染的压力情景;
  6. 由人复核共同遗漏和共同假设。

另一篇2026年9月的股票与加密市场人工智能综述,提出了“从信息到收益的转换链”:时点正确的信息必须变成稳定信号、可行持仓、可执行订单,并在成本之后留下风险调整结果。综述认为,预测、文本处理、组合设计和工作流整合已有上游进展,但持久的净表现证据仍薄弱。相关性审计应放在这条链里,因为软件层面看似分散的系统,可能实际上共享同一套信息。

一个有边界的研究练习。 用60分钟做一次纯研究测试:选一组公开财报,并固定历史信息截止点。基线是一名分析员或一个模型制作的简短证据表。然后让三个彼此隔离的系统回答同一个问题,使用不同模型家族,或使用明显不同的检索来源。记录主张层面的相同率、无证据主张率、证据新鲜度、遗漏数量,以及删去一个来源后结论是否改变。先观察一个截止点,时间允许时再用第二个截止点重复。若无法还原每条主张来自哪个来源,若系统看到了其他系统的输出,或开始根据结果改变指标,就应停止。不要下单、排名证券,也不要把练习结果当成建议。

限制同样重要。相关性可能来自真正共同的事实,而非共同错误;小样本也可能把噪声误判为依赖。模拟不能证明真实市场中的因果关系,公开研究还会受到选择偏差、生存者偏差、报告偏差和基准偏差影响。检索服务与模型供应商也有动力展示能力,而不是展示失败。最后,主张层面的相关性不一定能预测最终持仓的相关性,因为人、风险限额和执行成本仍会介入。

对主观投资者,重点是追问共识背后是否存在独立证据。对系统团队,模型多样性应按输入和失败模式衡量,而不只是看架构名称。对工具建设者,有价值的功能可能是一份保留隔离运行、时间戳和异议的证据账本。人工智能可以改进一个组件,却不能保证整个系统更稳健。

延伸阅读:Agentic Trading Evidence Ledger、LLM Forecasting Needs a Memory Firewall和Time-Series Foundation Models Need Deployment Diagnostics。

来源:Ross等,《Why Better Models Can Create Riskier Systems》(arXiv:2609.04373);《Artificial Intelligence in Equity and Crypto Markets》。两者均为预印本,不是经过审计的真实资金业绩证据。


Read in English →