研报总结
一、从SSM, Mamba到Mamba2模型
- 结构化状态空间模型(SSM):源于控制理论,后被引入深度学习,通过“状态方程+观测方程”压缩历史信息至低维状态,实现长依赖建模。离散化后可转化为循环或卷积形式,卷积形式更利于并行训练。
- Mamba模型:在SSM基础上引入“参数化SSM的输入”,实现“选择性状态压缩”,在效率与效果间取得折衷,兼顾RNN/SSM的高效与Transformer的表达力。
- Mamba-2模型:通过半可分离矩阵(SSD)分解,将SSM计算重写为矩阵乘+少量结构化算子,实现与GPU硬件高度匹配,形成“表达力-效率-可扩展性”的三重平衡,适用于超长上下文、吞吐敏感且部署成本受限的应用场景。
二、Mamba2模型与GRU选股效果比较
- 对比实验:选取10分钟、30分钟、60分钟、一日四种频率的基础量价数据,对比Mamba2与GRU模型的选股效果。
- 结果分析:
- Mamba2在日频数据上整体表现优于GRU,60分钟频不分伯仲,30分钟频对沪深300有优化,10分钟频优势收敛。
- GRU与Mamba2的“截面信号”相关性约70%–80%,二者并非冗余,通过模型-频率合成有望带来增量信息与风格分散。
三、模型合成与宽基指增策略
- 引入市场信息:构造三大宽基指数点位、时间信息、Barra风格指数作为附加输入,发现三大宽基指数信息提升最显著,时间/风格信息效果有限。
- 损失函数选择:MSE在多数指标上表现最好,Focal/Huber可增强鲁棒性。
- 模型合成框架:“GRU(4频)+Mamba2(3频)+GJQuant因子→LGBM”的二层合成架构,多空年化收益率与夏普比率持续抬升,多空波动率未同步放大,带来真实Alpha增量。
- 因子重要性分析:GRU-daily、GRU-10min、Mamba-60min贡献度较高,“低频的稳健趋势”和“中高频的结构波动”均不可或缺。
- 宽基指数增强策略:
- 沪深300、中证500、中证1000指增策略年化超额分别达9.99%、12.20%、20.65%,信息比率分别为1.88、2.24、3.31,主动层回撤均小于指数本身。
总结
- Mamba-2模型在长序列任务上通过“选择性状态压缩”兼顾效率与效果,并通过SSD分解实现并行计算,优于纯注意力与传统RNN/SSM。
- 模型-频率合成(如GRU+Mamba2)有望带来增量信息与风格分散。
- 构建的“GRU(4频)+Mamba2(3频)+GJQuant因子→LGBM”合成架构表现优异,三大宽基指增策略均取得显著超额。
风险提示
- 模型存在时效风险,政策、市场环境变化可能导致结果失效。
- 策略收益受交易成本等条件影响,可能下降甚至亏损。