AI 投资前沿 — 三个矩阵,少一点预测幻觉
一篇最新论文用价格、成交量和市值构造三个市场状态矩阵,提醒投资 AI:状态表示和样本外纪律可能比更大的预测器更重要。
一篇 7 月 29 日发布的 arXiv 新论文提出了一个值得投资 AI 团队认真对待的问题:组合系统真正缺的,究竟是更大的预测模型,还是更好的市场状态表示?论文只使用日价格、成交量和市值,构造三个固定尺寸的矩阵,再把它们用于动态组合管理。
这不是可以直接复制的交易策略,却是一个很好的工程提醒:如果状态定义不稳、标签几乎不可预测、成本假设又过于乐观,增加模型复杂度通常不能解决根本问题。
前沿信号
论文用相关性收益距离矩阵,替代一部分传统组合优化中的结构;另外两组矩阵记录个股过去收益排名和波动率排名的转移。方法不需要矩阵求逆,并通过横截面排序降低异常值的影响。
作者报告称,下一期波动率排名具有可预测性,而收益排名接近不可预测。在两个样本外区间——2022 年 1 月至 2024 年 12 月,以及 2025 年 1 月至 2026 年 7 月——一个动量多空组合加上机会型多头组合,扣除 5 个基点交易成本后,报告夏普比率分别为 1.06 和 1.32;市场对应为 0.78 和 1.14。加入基于残差距离的分散化后,报告结果进一步提高。
这些是论文的结果,不是独立复现,也不是投资建议。
为什么投资者在意
这项工作的价值不只在于收益数字,而在于它把可用信息先压缩成可检查的结构。组合引擎可以从相关性、排名转移和风险状态出发,而不是先让一个复杂模型输出难以审计的概率。对正在建设智能体研究流程的团队来说,这种可追溯性很重要;智能体交易证据账本也强调了证据与叙事的分离。
它同样补充了金融收益先验与时间序列基础模型的讨论:无论表示来自基础模型还是简单矩阵,都必须回答同一个问题——新增结构在现实测试中是否带来稳定信息。
技术解读
整套流程可以拆成四层。第一层从收益相关性得到资产之间的距离。第二层把个股的过去收益和波动率转换成月度横截面排名。第三层用转移关系预测下一期状态。第四层把预测映射为市场中性动量多空仓位和多头仓位,再用距离信息做分散化。
对构建者而言,模块化比“用了什么模型”更关键。状态构造、可预测性检验、组合映射和风险覆盖应分别评估。如果收益排名本身难以预测,系统仍然可以利用相对可预测的风险状态来控制敞口和换手。
两个相互独立的样本外区间也比一条很长的回测更有意义。下一步应当使用冻结代码复现,并纳入点时成分股、退市股票、换手归因和独立成本重建。
现实校验
夏普比率不是普适性证明。股票池、回看窗口、调仓周期、约束条件和成交假设都会改变结果。5 个基点对部分股票、市场阶段和资金规模可能过于乐观;市场中性组合还要面对借券费、容量和冲击成本。
“不需要矩阵求逆”也不等于没有模型风险。窗口、成分股、标准化、缺失值处理和距离定义依然是研究选择。第二个样本外区间延伸至 2026 年 7 月,观察期仍然有限,不能轻易外推。残差距离分散化也应换用不同距离度量,并检查在更严格约束下是否仍然有效。
构建者要点
- 把市场状态表示当作独立研究资产,版本化并先检查其稳定性。
- 分开检验风险排名和收益排名的可预测性,不要默认二者同样容易学习。
- 将组合映射、换手、容量和成本假设一起报告。
- 加入点时股票池、退市、借券成本和更严格的滚动样本外边界。
- 保留简单基线,让每个新增模型或表示都证明自己的复杂度值得。
链接 / 来源
- Are Three Matrices All You Need To Beat the Market? — 论文及摘要,2026-07-29 发布。
- 智能体交易:证据账本 — 内部流程背景。
- 时间序列基础模型与金融收益先验 — 内部表示测试背景。
- English companion: Three Matrices, No Forecasting Theater — 今日信号的英文 companion。