核心观点
- 经典线性因子模型(如APT、Fama–French)存在局限,依赖线性与平稳性假设,难以捕捉公司特征的异质性和市场状态的时变特性。
- 条件自编码器(CAE)模型通过允许因子载荷非线性地依赖于公司特有的滞后特征,推广了线性因子模型,提升了潜在因子收益的信噪比和样本外预测的稳定性。
- 引入不确定性感知因子选择方法,根据因子的样本外可预测性选择潜在投资组合,利用高维潜在表示的表达能力并控制估计风险。
研究方法
- 两阶段流程:首先使用CAE模型从公司特征和资产收益中提取潜在因子投资组合;其次利用多种模型对每个潜在因子的时间序列进行预测,并基于预测不确定性指导筛选具有可预测收益的投资组合。
- 考虑三种预测模型:基于样本的非参数基准IID-BS、监督回归树方法Q-Boost,以及零样本预训练的基础序列模型ZS-Chronos。
实证分析
- 采用美国市值最大的2000只股票的月度收益数据进行方法评估,时间跨度为1962年2月至2024年12月。
- 训练了六种CAE架构,每种对应不同的潜在因子数量,K∈{5, 10, 20, 30, 40, 50},系统地考察模型的可扩展性及预测效能随潜在复杂度变化的情况。
- 将预测不确定性纳入潜在因子选择,能够在所有模型架构下显著提升投资组合表现,如图表6所示的风险-收益前沿。
- 自适应选择方法κ𝑡(𝑚)∗仅依赖决策时点t可获取的信息,采用时间正则化目标来自适应优化,优先考虑索提诺比率。
研究结论
- 基于预测不确定性有选择地使用潜在因子,能够在多种预测模型中持续提升风险调整收益,表现最佳的portfolios往往仅使用可用潜在因子的一个子集。
- 集成三种不同的预测方法(IID-BS、Q-Boost与ZS-Chronos)产生基本不相关的预测信号,集成策略显著优于单一模型,其中表现最好的集成策略实现了2.20的夏普比率、4.01的索提诺比率、5.95的欧米伽比率,最大回撤低于10%。
- 消融分析排除了与预训练ZS-Chronos模型相关的潜在数据泄漏担忧,证实其优异表现并非源自隐藏偏差,而是基于内部生成的合成潜在因子,保持了完全的数据独立性。
关键数据
- 自适应策略在2000年至2024年的整个样本外期间均表现出持续强劲的性能,累计收益均跑赢市场(SPY),即使在市场出现回撤的年份,几乎所有模型仍能产生正收益。
- 集成(A)实现了最高的夏普比率(2.20)与欧米伽比率(5.95),以及最低的年化波动率(6.52%)和最大回撤(9.22%)。
- 集成(B)则取得了最高的索提诺比率(4.22),同时保持负的贝塔值(对市场呈负相关)。
- 平均月度换手率约为2.0,表明模型每月大约会再平衡其一半的头寸。