随机森林模型在REITs基金中的应用
随机森林模型介绍
随机森林是一种基于多个决策树的集成学习技术,通过构建多个决策树并将它们的预测结果集成起来。其核心思想是搭建多个决策树模型,并将它们组合起来进行预测,通过集成多个模型提高准确性、抗过拟合能力,并提供特征重要性评估。
样本选定
- 数据获取:测试区间内上交所、深交所全部未停牌REITs基金,截至2025年7月18日共68只基金;样本内训练区间为2021年7月1日至2024年6月30日;样本外测试区间为2024年7月1日至2025年7月18日。
- 特征和标签提取:每周最后一个交易日计算因子暴露度作为样本特征,计算到下一周的收益率为因子得分。
- 特征预处理:对每个截面因子取z-score进行标准化,缺失值用前值填充。
- 训练集合交叉验证集合成:训练集为2021年7月1日至2024年6月30日,采用10折交互验证方法或每次随机选取90%的样本作为训练集,余下10%的样本作为交叉验证集。
- 交叉验证调参:通过样本内交叉验证得到平均的预测准确率,选取准确率最高的一组参数作为最优参数。最终选定最大深度为15,叶节点最小样本数为15作为最终参数。
- 样本外测试:确定最优参数后,在样本外以每周最后一个交易日得到的特征作为模型输入,得到每个样本当期因子得分,选取得分最高的top5组合构建策略,以下一个交易日收盘价为调仓价格,进行策略测试。
随机森林因子选择
- 采用因子IC作为筛选标准,选取截面因子IC绝对值在2.5%以上的因子作为模型因子拟合。
- 选定因子列表包括:...
随机森林模型构建
- 参数敏感性分析:
- 决策树的数量:在1到200范围内对n进行测试,通过10折交互验证方法,选择均方根误差(RMSE)局部最低点n_estimators=100进行后序测试。
- 特征个数(max_features):此次模型中,筛选过后的因子合计27个,故不做特殊限制。
- 树的最大深度(max_depth):不做特殊限制。
- 叶节点所需最小样本数(min_samples_leaf):结合树的最大深度(max_depth)常见取值,通过网格搜寻找到相对较优的参数。最终选定最大深度为15,叶节点最小样本数为15作为最终参数。
- 模型结果:样本内拟合结果为均方误差(MSE)为0.00044,均方根误差(RMSE)为0.021,决定系数(R²)为0.501。
- 样本外实际组合模拟:
- 组合属性:每周最后一个交易日通过随机森林模型选择模型得分最高的5支REITs基金构建组合,下周第一个交易日调仓。
- 组合绩效表现:截至2025年7月18日,REITs随机森林策略年化收益率39.76%,超额收益率40.01%,夏普率2.82。年初至2025年7月18日,策略组合收益率73.81%,超额收益率60.49%。
随机森林模型评价
- 优点:
- 非线性关系捕捉
- 鲁棒性
- 特征重要性评估
- 处理高维数据
- 适应性强
- 可解释性
- 可拓展性
- 缺点:
- 复杂性和计算成本
- 模型解释性
- 超参数调整
- 过拟合风险
- 数据不平衡处理
风险提示
量化模型存在失效风险,信息仅供参考,不构成投资建议。市场存在波动性和不确定性,投资需谨慎。过去的业绩表现不能保证未来的收益,投资者应根据自身的风险承受能力和投资目标独立判断并做出决策。