检索何时真正帮助投资研究:先回答,再决定是否找资料

一项新的金融推理基准显示,检索应该是有条件的工作流组件:先测量它挽救了什么,也测量它推翻了什么。

检索何时真正帮助投资研究:先回答,再决定是否找资料

AI 改变投资研究的一个具体地方,不是“每个问题都先搜索”,而是让研究员可以测量:什么时候补充资料真的有帮助,什么时候反而会把正确答案改错。最近的 FinExam-10K 基准研究测试了模型处理金融考试题的能力,包括专业知识、计算和判断。研究原文给出的实际启示,是把检索变成一个有条件的步骤。

在 17 个模型中,最高总体准确率为 85.29%,但更困难的完整覆盖测试明显更难。检索工具确实挽救了数百个错误,同时也推翻了不少原本正确的答案。一个门控器只在判断有需要时调用图检索,在保留测试集上对 7.9% 的问题启动检索,准确率由 70.83% 提高到 71.23%。这是研究协议中的小幅、统计上报告的改善,不是投资收益或交易优势;但它给出了清晰的操作原则:先回答,再选择性检索,最后比较变化。

过去,研究员往往先搜索文件,把一大批内容交给模型,再接受流畅的总结。新的流程把初始答案当成分流信号。如果问题已经能由给定材料回答,而且证据充分,就保留它。如果缺少定义、计算过程或关键段落,再只检索相关证据并重答。最终交付物不只是答案,还应记录检索是帮助、伤害,还是根本没有必要。

对投资团队而言,这适合核对财报中的比率、把管理层表述与脚注对齐,或整理风险披露。它不等于让模型生成证券观点。该基准研究的是结构化金融推理,不是实时行情、执行或组合收益。因此证据支持的是研究流程设计,不支持“检索能提高投资回报”的说法。

可以这样复现。先建立一份带时间戳的公开财报或研究笔记资料包,在打开模型前写好 20 道题:10 道应能从资料包回答,5 道需要计算,5 道故意不提供答案。要求模型给出简短理由和证据位置。随后设置简单门控:只有在答案缺少引用、计算无法核对或模型明确不确定时,才检索一两段相关材料,而不是把整个档案塞进去。模型重答后提交变更记录。人工审核计算、资料日期,以及引用段落是否真的支持结论。

这也延续了我们关于投资 AI 决策链的讨论:可复盘记录本身就是研究成果。还可以参照金融基础模型的时间完整性:检索可能提高覆盖率,却把决策时点之后的信息偷偷带入。来源时间和资料边界必须进入测试,而不能只写在注释里。

用 60 分钟做一次纯研究练习。前 15 分钟建立带日期的资料包,并标出每段材料的公开时间;接着 20 分钟不检索地完成 20 道题;再用 15 分钟运行门控检索并重答;最后 10 分钟审阅记录。无检索结果是基线。记录总体准确率、计算准确率、引用蕴含度(引用是否支持答案)、检索比例、有害反转率(原本正确却因检索变错的比例),以及对故意缺失问题的拒答率。

如果无法保存资料包和时间戳,审核者不能凭引用重现答案,或检索造成的有害反转多于真正挽救的问题,就停止练习。不要把结果转成纸面交易或实盘流程。若做七天延伸,每天用新的文件重复测试,但固定评分标准,并把当天题目与模型此前输出分开。

限制同样重要。门控器在公开样本上调优后,未必能识别新的文件格式、会计规则或市场环境。检索质量也可能成为瓶颈:看似相关的段落可能过时、不完整,或只是语义相近而非真正有证明力。FinExam-10K 的结果正说明平均准确率不够:检索可以同时帮助和伤害。生产环境还要处理权限、资料许可、隐私、模型版本变化和人工复核容量。

个人投资者应测量证据质量和错误反转,而不是被流畅表达说服。系统研究员应把检索视为有条件组件,保留固定基线并做样本外检验。工具建设者则应把决策日志、来源时间、拒答路径和人工覆盖设计成一等输出。AI 真正改变研究流程的地方,是让这些比较更便宜、更可见;它并没有替人判断证据是否完整、及时且真正相关。


Read in English →