投资研究用上大模型之前,先设置一道人类可复核的复现闸门

大模型正在把论文复现变成更快的研究流程,但真正的价值取决于每个结论是否留下来源、计算和分歧记录。

论文、代码笔记本和证据账本通过人工复核节点相连的社论插画

大语言模型在投资研究中最值得测试的用途,可能不是让它预测市场,而是让它先回答一个更朴素的问题:一篇已经发表的研究,能不能被重新做出来?模型是否能展示用过的数据和代码,并把原论文的发现与自己提出的延伸严格分开?

Matthew Schwartz、Isaiah Andrews 和 Jesse M. Shapiro 于 2026 年发表的 NBER 工作论文 《An LLM Workflow That Reproduces, Improves, and Extends Published Economics Research》,把这条路径具体化。它说明的不是模型已经找到稳定的交易优势,而是模型可以缩短从论文到可执行复现方案的距离。代价是:研究流程留下的内容更多,也更需要审计。

过去,研究员要读论文、理解识别策略、寻找数据、写代码,再判断结果是否成立。现在,大模型可以插入每个交接点:提取论断、匹配数据来源、起草代码、提示检查项目,并生成差异报告。人类仍然负责研究问题和信任边界,但第一轮工作不再只是流畅摘要,而可以变成一个可测试的中间产物。

关键是把流程设计成一串证据收据。先冻结论文的发布日期、样本区间、表格和结果变量。再让模型建立“论断登记表”:每一行对应一个假设、变量定义、样本限制和统计量。每行都必须指向论文页码或表格、原始数据文件,或者具体代码单元。连接、变换、描述统计和置信区间交给确定性工具计算。模型可以负责把文字转成代码、解释报错、提出稳健性检查,但不能悄悄补缺失值,也不能凭空创造数据集。

最终产物不应是“人工智能同意这篇论文”,而应是三类账本:已复现、未复现、无法测试。另设一栏说明原因:数据不可得、定义含糊、代码不一致、抽样不同,还是结果确实出现差异。这和可审计的研究队列是同一个操作原则:有价值的单位是带日期、可检查的任务,而不是漂亮的段落。它也延伸了投资建议的证据根基测试:有引用是必要条件,却不等于真的复现过引用中的结果。

对投资团队来说,这会改变研究筛选。量化研究员可以据此决定哪些学术信号值得独立重写;主观研究员可以把论文测得的证据与模型补出的经济解释分开;数据和人工智能团队则能分别衡量检索、变量映射、代码执行、数值比较和解释环节的失败率。分环节测量,比一个笼统的“研究助手准确率”更有用,因为摘要可以很准确,单位或时间窗口却可能已经错位。

可以做一个安全的 60 分钟研究练习。选择一张拥有公开数据、且不涉及实时交易的已发表表格。前 15 分钟,人工记录论文日期、样本、结果和基准统计量;接着 25 分钟,让模型生成论断登记表和复现方案,要求提供来源链接并明确未知项;再用 15 分钟通过确定性工具运行或核对计算;最后 5 分钟给每条论断分类。基准是研究员未使用模型时手工记录的论断和统计量。指标包括:有有效来源的论断比例、可复现时的数值一致率、错误标记为“已复现”的比例,以及形成可审阅差异清单所需时间。若模型提出论文中没有的数据、无提示地改变样本,或无法留下人类可读的审计轨迹,就停止。不要把结果变成交易或纸上组合。

因果边界必须写清楚。复现更快,不代表有经济价值、样本外稳健性或可投资性。能被关注的研究本来就可能存在选择偏差;复现过程还可能继承幸存者偏差和报告偏差。模型可能过度贴合论文措辞,泄漏后来版本的信息,或采用看似合理却改变估计对象的代码选择。数据许可、算力预算和团队激励,也会决定哪些论文得到检验。即使复现成功,换一个市场状态、扣除成本滑点,或许多人同时使用同一信号后,也可能失效。

因此,判断应保持克制:当人工智能把论断变成可检查的实验时,它正在为投资研究创造真实的流程价值。采用标准不是模型听起来像不像分析师,而是流程能否保留来源、暴露分歧,并让团队在未经验证的结果接触资金之前及时停下。


Read in English →