投资智能体先要交出可审计的研究队列,再谈自主决策
投资智能体可以替研究团队整理阅读队列,但真正有价值的单位不是漂亮摘要,而是可追溯、可复核的证据主张。
投资研究智能体不该从“替我写一份市场观点”开始,而应先回答一个窄得多的问题:哪些新主张值得分析师投入时间,而且系统能否说明它为什么把这些材料排在前面?
近期关于“智能体研究台”的讨论,真正重要的地方不是摘要写得更像人,而是工作流发生了变化:智能体扫描大量材料,抽取主张,寻找与既有研究的重叠,再把少数项目送入深度复核。它可能改善注意力的分配,却也可能把没有记录的排序悄悄变成投资判断。
我的判断是,应该先测试“队列”,不要先测试自主结论。每个项目都应保留来源、时间戳、原文摘录、入选理由、未解决问题和人工处理结果。否则,智能体也许减少了阅读时间,却让研究过程更难重演。
从读完所有材料,到路由可核验主张
传统流程是分析师监控财报、电话会、数据发布和研究报告,先判断相关性,再把段落复制进笔记,最后决定要查什么。新流程在信息源和分析师之间加入智能体:它可以分类、去重、抽取可检验的主张,并提出下一步核查。
这是一项工作流变化,不是投资表现证据。Funds Europe 对智能体研究台的描述包括扫描材料、找出值得深入阅读的内容、抽取关键主张,以及标记与既有研究的重叠:Agentic AI and research: the agentic research desk。这是行业报道,因此能支持对工作方式的描述,却不能支持“这样就能提高收益”的结论。
这条队列也连接到一个可测量的信息问题。WisdomChain 的表现报告把智能交易与证据账本列为有搜索展现却没有点击的页面,也列出时间序列基础模型这一搜索机会。这不意味着搜索指标验证了投资观点;它提醒我们,投资 AI 工作流既要有来源链,也要有反馈回路:什么被筛出、什么被核验、什么对分析师真正有用。
一个可以复现的队列
小型研究团队不必先做聊天机器人,可以先做一张表:
- 只接收有日期的来源。 保存网址、发布时刻、抓取时刻和文档哈希,并区分原始财报或论文、供应商材料和新闻转述。
- 每份材料只抽取一个主张。 要求一句简短、可证伪的话和准确的支持段落。段落不支持这句话时,应标为失败,而不是让模型把措辞润色得更顺。
- 标记工作类型。 可以用新证据、矛盾、数据质量问题、实施细节和背景材料等标签。第一轮不要使用“可能可交易”,否则容易过早进入结论。
- 检查重叠。 检索最接近的旧笔记,同时展示摘录和日期。相似度只是路由信号,不是两项主张具有相同经济含义的证明。
- 安排下一项核查。 例如核对两份财报中的定义、检查观察是否穿过日期截止点,或请分析师阅读完整来源。
- 记录人工处理。 接受、拒绝、延后和升级都应留下简短理由,这才形成可以评估队列本身的数据。
人工复核不是装饰。分析师仍需检查日期、单位、分母、数据修订,以及来源是在报告观察还是提出因果解释。模型也可能因措辞不同而漏掉相关文件,或因多家媒体互相转载而把重复主张排得过高。
一个 60 分钟的研究测试
准备一个固定、不可用于交易的材料集:来自一家公司、一个行业或一个宏观主题的 20 份有日期文档,并设定统一截止时间。不要下单、调整组合,也不要把结果当成个性化建议。
前 20 分钟人工挑出最想复核的十项,为每项写一个主张和一个理由。然后用冻结的提示词让智能体处理同一材料集,记录它的前十项。接着用 20 分钟在盲化表格中对照两份名单。测量前十项精确率、无证据主张比例、重复比例、核验一项主张的中位时间,以及不同复核者对“下一步核查”的一致率。最后 20 分钟检查假阳性和假阴性。
基线是人工名单及其核验时间;观察窗口是这一次 60 分钟测试。如果结果可解释,再对第二个有日期的材料集重复。若无法恢复原文、用截止时间之后的信息评估排序,或复核者无法区分原始证据与生成措辞,就应停止。时间更短并不等于成功:如果无证据比例或重要遗漏比例上升,速度没有带来质量改善。
自主性仍然解决不了什么
选择偏差在模型看到材料之前就出现了:信息源可能漏掉私有研究、索引不佳的内容或不方便的证据。只评估最终产生成功想法的队列,会产生幸存者偏差。若把“有用”只定义成更快接受,而不测量校准或矛盾遗漏,又会产生测量偏差。供应商有动机把原型称为研究台,投资团队也可能只报告成功升级的项目。
还有更深的因果断层。队列组织得更好,可能改善分析师注意力,却不一定改善投资决策。市场不平稳,文件会修订,同一个模型还可能让不同团队形成相关的解释。数据泄漏也很容易发生:基准或档案中可能已经包含透露答案的后续评论。合规、机密性、保留期限和模型版本控制,都是上线条件,不是演示结尾的一段提醒。
因此,值得推进的前沿比“自主投资”窄得多。构建者应把来源、回放、截止时间和拒绝理由设为一等字段;系统研究者应先把队列当作测量系统检验,再把它接入信号;主观投资者应把智能体排序理解为注意力请求,而不是建议。只有当队列能被审计、质疑并随时停止,智能体研究台才值得获得更大的权限。