一、核心观点
本报告提出“量价指纹”概念,借鉴大语言模型的语义理解思想,将市场交易数据视为一种特殊“语言”,通过自监督学习理解、提取日内量价行为中蕴含的特征,生成日度“量价指纹”,并在端到端深度学习选股模型中进行初步应用。
二、量价指纹的构建
量价指纹的构建流程遵循从原始数据处理到深度语义表征的路径,围绕分钟特征处理、双任务自监督学习、防坍缩正则化三个关键环节展开:
- 分钟特征预处理:选取32维分钟级特征(包括价格特征和交易特征),并分别进行标准化处理。
- 双任务学习框架:通过前向因果预测任务(价格特征预测)和后向特征重建任务(交易特征重建),迫使模型学习市场量价关系的动态语义与因果结构,生成128维日度指纹向量。
- 防坍缩设计:引入多样性、正交性和均匀性正则项,确保指纹向量具备高区分度、低冗余与信息丰富的特性,避免表征坍塌。
三、量价指纹的端到端应用初探
将“量价指纹”作为输入特征,结合GRU模型,对股票的未来收益进行预测,初步验证了其在市场预测中的有效性:
- 单一数据集测试:仅使用量价指纹进行模型训练得到的因子,具备一定的预测能力。2017/01/01-2025/12/31,因子的周度RankIC均值为0.106,全市场10分组多空对冲的年化收益为83.88%,信息比率为5.41,最大回撤为11.65%。
- 量价因子和量价指纹融合测试:量价指纹可在用常规量价因子构建模型的基础上,提供增量信息。双流GRU模型结合量价指纹与量价因子,进一步提升了预测能力。融合因子的周度RankIC均值为0.109,全市场10分组多空对冲的年化收益为90.89%,信息比率5.95,最大回撤为11.54%。
- 指数增强组合的表现:基于融合因子构建的指数增强组合,在严格的风险约束条件下,仍能取得稳定、可观的超额收益。例如,沪深300指数增强组合的超额年化收益为7.12%,跟踪误差为1.74%,信息比率为4.10,月度胜率为86.11%,最大回撤为1.85%。
四、未来研究展望
未来将尝试深化指纹语义解析、探索α/β分离建模、推动指纹与传统因子的协同应用,进一步挖掘指纹中蕴含的丰富信息。
五、风险提示
以上结论均基于历史数据和模型的测算,如果市场环境和结构发生剧烈改变,不排除模型失效的可能性;单模型的收益可能存在较大波动,实际应用需结合资金管理、风险控制等方法;模型测算可能存在相对误差,不构成实际投资建议。