主要观点
- 研究背景与动机:运用大语言模型(LLM)进行量化因子挖掘,通过理解算子经济含义生成语义合理的因子表达式,提出有语义引导的定向搜索方法,以LLM替代随机变异算子,并将回测反馈闭环注入每轮迭代因子生成过程,实现Alpha因子自动发现。
- LLM引导下的搜索机制:该机制在有限轮次内高效定位高质量因子,LLM在生成新候选前读取当前最优因子的内容和绩效,生成的候选在金融逻辑上更合理,无效输出比例下降,搜索效率远高于盲目随机。以Alpha158的38个种子因子出发,经15轮迭代后样本内IC从0.010提升至0.040,ICIR翻倍至0.24。
- 因子生成阶段引入LLM进化搜索:在稀疏投资组合优化任务中,部署的两个大模型在美国50股、恒生45股、沪深300三个市场的累积财富均优于全部对比方,同时夏普比率同样领先所有基准。
关键数据和研究结论
- 多轮迭代下的因子趋势:以Qlib框架的Alpha158因子库为初始种子池,在沪深300指数上运行15轮静态搜索,样本内IC、RankIC及ICIR均呈现整体上升趋势,验证了LLM引导的进化搜索能够持续提升因子质量。
- 不同稀疏度与市场条件下的投资组合优化对比:LLM方法在累积财富和夏普比率方面均显著优于传统基准。以US50、m=10为例,DeepSeek-V3的累积财富达到25.101,约为最优传统基准ASMCVaR的2.4倍;GPT 4.1同样表现优异。在CSI300市场,LLM方法的相对优势收窄,但绝对意义上仍优于所有基准。
研究方法
- 模型框架与算法设计:将进化操作直接嵌入到LLM提示词中,通过变异和交叉操作生成新的候选因子,并将评估结果注入下一轮提示,形成持续进化的闭环。
- LLM提示词设计:变异提示词限定算子集合和合法表达式语法,指示模型对种子因子做局部小幅改动;交叉提示词要求模型识别不同种子因子中各自承担不同角色的子表达式,并将互补部分重组为新因子。
未来工作与局限
- 未来工作:引入多模态信号、改进提示词策略、探索轻量化蒸馏方法。
- 局限:基本面、另类数据等信号尚未纳入种子库;LLM的API调用成本和回测计算开销;变异率与交叉率的比例设置有待检验;A股等市场的制度性特征对提示词工程提出更高要求。