核心观点与结论
本报告探讨了机器学习模型在量化投资中特征工程的重要性,并对比了不同特征选择方法、因子中性化处理以及另类因子引入的效果。研究发现,特征工程能够显著提升模型性能和可解释性。
特征选择方法对比
- 基础统计方法:包括Spearman相关性、互信息和LightGBM模型重要性筛选。Spearman相关性方法在全A股市场上表现最佳,互信息方法也相当出色。
- SHAP方法:基于SHAP解释的LightGBM和GRU模型在因子选择上表现优异,能够直观展示因子作用,提升模型精度。
- STG方法:STG方法在当前模型和数据环境下表现平庸,未能展现出明显的优势。
因子中性化效果
- 因子中性化:对因子进行行业和市值中性化处理能够有效降低其他因素的干扰,但对GRU模型和LightGBM模型的影响存在差异。
- 标签中性化:对模型输入端因子和标签进行行业和市值因子的回归,并使用回归残差作为新的输入因子和标签进行模型训练,能够显著优化LightGBM模型的表现。
另类因子引入效果
- 宏观指标等截面不变的因子:加入宏观经济数据和BARRA因子收益率等另类因子,能够在一定程度上提升LightGBM模型的超额收益,但总体而言缺乏显著的正向作用。
- 高频因子:高频因子在小微盘股上显示出较高的有效性,而在大中盘股上的应用方法仍需进一步探索。
特征工程优化的GBDT+NN指数增强策略
- 模型结构:结合SHAP特征选择改进的NN模型和经过中性化标签合成改进的GBDT模型,形成特征工程优化的GBDT+NN增强策略。
- 策略效果:
- 沪深300指数增强策略:年化超额收益15.83%,超额最大回撤3.18%。
- 中证500指数增强策略:年化超额收益18.23%,超额最大回撤8.21%。
- 中证1000指数增强策略:年化超额收益32.24%,超额最大回撤3.88%。
风险提示
- 模型存在时效的风险,在政策、市场环境发生变化时可能失效。
- 策略收益受交易成本和其他条件影响,可能导致收益下降甚至出现亏损。