国金证券研究员介绍了运用大模型自动化挖掘财务因子的创新方法,该流程融合了大模型的高效与解释性优势,弥补了传统人工和机器学习方法的局限。大模型因子挖掘框架通过MMR模块控制因子相关性,随机初始化增强模型创新性,并借助IDEA提取阶段进行因子对比分析,有效解决了以往方法中因子相关性高、缺乏创造性及反馈机制不足的问题。
大模型因子挖掘框架主要分为三个阶段:模型初始化阶段、因子改进阶段以及idea提取阶段。在因子改进过程中,为解决因子相关性过高影响合成效果的问题,会调用MMR模块限制因子的相关性;为提升模型创造性与实用性,采用随机初始化方式,避免基于成熟因子的改进限制模型创新性;同时,增加显示反馈机制,通过对比改进前后因子,在优化逻辑不明晰的情况下获取优化经验和未来分析依据。全天候自动化挖掘框架分为内层循环和外层循环。内层循环负责并行挖掘少量因子并筛选出内部表现良好的因子,外层循环则对内层挖掘出的因子进行收益控制和已有因子相关性测试。内层循环每轮可挖掘二十多个因子,挑选2-3个优秀因子入库,整个流程一般耗时2-3小时,整体挖掘效率较高。
传统因子挖掘方法存在效率低和解释力不足的问题,而大模型能够兼顾这两点,通过API批量调用生成因子计算公式并解释其生成逻辑。在因子挖掘过程中具体是如何运用IG机制的?在因子改进阶段,IG机制用于结合随机改进、经验改进和成熟因子改进等多种方式。在处理海量数据匹配时,利用成熟因子与数据量做向量化和向量匹配。匹配到相关信息后,将其作为增强信息添加到prompt中,增强prompt文本,再与大模型对话生成新因子。此外,还会使用MMR指标综合考虑因子与常见风格因子、风险因子的相关性以及持续相关性。
因子入库的标准是根据全样本内挖掘出的因子具有可解释性这一原则,选取2010至2019年十年的数据进行因子挖掘和筛选,并在2020至2025年期间进行检验,依据IC值和多头超额收益阈值选择入库。同时,对不符合量纲要求的算式进行约束,要求模型生成量纲匹配的公式。因子表达式要求模型生成多样化的公式,并确保其具有良好的解释能力,避免过于复杂以至于失去可解释性。在因子输出时,需要进行结构化的分析,考虑经济学假设、市场无调性行为偏见收益传导路径等因素,并从这些角度对生成的因子进行深入思考,最终形成易于理解的因子构造逻辑说明。输出格式要求严格遵循,因为后续公式提取、计算回测以及表达式的解释等环节均依赖于正确的输出格式。输出格式需符合正则表达式规则以便于处理,并且需要进行嵌入式操作以匹配后续语义需求。
报告介绍了使用大模型挖掘量价和基本面因子的方法,展示了因子设计的逻辑及其在市场中的表现。通过对比原始因子与改进因子,证明了大模型在因子改进方面的灵活性和有效性。量价因子表现出色,年化超额收益率达17.4%,而基本面因子虽波动较大,但风险暴露较小。整体上,大模型的因子挖掘效果良好,特别是在结合量价和基本面信息时,展现了其在量化投资领域的潜力。已构建一套完整的大模型挖掘系统,涵盖因子计算、回撤表现、数据库存储及因子回测,集成所有关键参数与表现于统一框架。大模型并不擅长直接进行数据计算,所以采用此方式更为合适。