把证据与投资偏好分开:提示词正在改变研究结论

一项新的金融大模型审计显示,投资研究应把证据评分与个性化解读拆成两条可复核的输出。

把中性的财报证据分析与个性化投资偏好分开的证据账本

AI进入投资研究后,真正值得改变的并不是“能不能总结一份10-K”,而是能否检验:当证据完全不变、投资者画像发生变化时,模型的结论是否也跟着变化。这样一来,提示词就不再只是写作技巧,而成为可以审计的研究流程。

2026年9月一篇工作论文《The Analyst in the Prompt》用3,575份SEC 10-K和10-Q文件测试了12个模型。研究把个性化检索、中性检索和记忆式上下文分开,发现用户上下文造成的偏移,主要来自模型对同一批证据的不同解读,而不只是检索到了不同段落。把投资者心态从“助手角色”改写为“用户画像”可以降低偏移,但不能消除。 论文原文

这会改变传统流程。过去,研究员可能让模型“扮演谨慎的价值投资者”,再把结果当作基于证据的风险判断。更稳妥的做法是拆成两项输出:**EvidenceScore(证据评分)**必须不随偏好变化;**PersonalizedScore(个性化评分)**才可以适应不同的投资任务。前者回答“这份披露支持什么”,后者回答“这对某一项投资授权可能意味着什么”。如果把两者混在一起,即使答案带有引用,也未必能发现模型风险。

工作流的变化:锁定证据,再改变上下文

投资数据团队可以在不连接交易系统的情况下实现这一点。先建立一个时点固定的文件包:财报、发布日期、相关表格、检索编号。然后用中性查询检索并冻结段落。让模型输出结构化证据记录:主张、原文摘录、页码或章节、影响方向、不确定性,以及-1到+1的中性评分。最后,使用几个授权画像重新读取同一批段落,并把个性化结果存入独立字段。

比较重点不是个性化答案是否不同;它本来就应该不同。重点是:画像改变后,中性评分、引用段落编号和不确定性标签是否移动。中性字段变化,说明发生了解读层面的偏移;引用段落变化,说明发生了检索层面的偏移。两者需要不同的控制:前者依赖检索快照和字段隔离,后者依赖保留证据版本与人工复核。

这与WisdomChain此前关于LLM预测记忆防火墙和智能交易证据账本的讨论相互补充。共同原则是来源可追溯:只有输入、时间边界和转换过程都能检查,流畅回答才算研究对象。

一个安全的限时练习

用60分钟选取三个行业不同的历史财报。固定一个截止日期,只使用当时已经公开的文件,不看当前价格、未来财报,也不下任何真实或模拟订单。准备一个中性提示词和三个投资授权画像。对每份财报记录中性评分、个性化评分、引用段落编号、证据缺口,以及复核者能否仅凭冻结段落重现判断。

以没有画像的普通提示词作为基线,记录四个指标:不同画像下的中性评分区间、段落重合率、无证据主张数量、复核者对证据标签的一致率。观察窗口为本次练习加上一次可行的24小时盲测。若系统无法保持文件截止日期、引用无法回到冻结段落,或复核者无法区分证据与偏好,就停止练习。产出应是一份控制报告,而不是组合信号。

低评分波动也不能证明系统稳健。三个文件只是诊断样本,并不能估计普遍可靠性。上述论文仍是工作论文;模型版本、提示词、检索系统和SEC文件构成都会变化。公开财报也不是专业投资者使用的全部信息,引用可复现不等于经济意义已经成立。数据泄漏、陈旧上下文、行业语言、非平稳性和复核者锚定效应仍然存在。

因此,结论很具体:个性化应位于证据层之后。主观投资者要检查偏好是否悄悄进入事实判断;系统团队应把提示词版本、检索快照和评分差异记录为模型风险字段;AI构建者应优化不随画像改变的证据记录和明确分歧,而不是追求一个有说服力的单一结论。只有当投资授权可以改变建议形态,却不改变财报本身表达的内容,研究工作流才真正获得了可审计的升级。

英文 companion:The Analyst in the Prompt: Separate Evidence From Investor Preference。


Read in English →