核心观点
本研究探讨了AI因子挖掘的双路径实践与Skill沉淀,旨在构建可迭代的AI因子研究流程。研究设计了两种互补的路线:LLM增强遗传编程和函数式因子挖掘,分别对应“可控表达式搜索”和“开放函数式生成”,共同目标是让AI参与因子研究的完整链条,并将可复用经验沉淀下来。
LLM增强遗传编程路线
- 方法:在表达式空间中引入LLM,构建LLM增强遗传编程框架。LLM从已有优质因子中提取子表达式基因,并在遗传编程进化过程中周期性生成具备金融逻辑的新个体;遗传编程则负责大规模搜索、适应度评价和低相关筛选。
- 结果:生成了87个候选量价因子,全区间|RankIC|均值约为6.98%,全区间|ICIR|均值约为0.79,测试集|RankIC|均值约为6.93%,表现较为稳定。约81.6%的因子对内部相关性低于0.70,约91.2%低于0.75。相对Alpha158MLP,平均增量IC约为2.53%。
- 代表因子:LOWPOS_SHARPE_COV(平滑趋势中的质量动量)、CANDLE_SHADOW_P3(上冲情绪后的短期反转)、RETCHG_MINUS_GAP(剔除跳空后的量价拥挤)等,表明该路线能够在保持表达式可复现性的同时,挖掘出具有较清晰金融逻辑的量价结构。
函数式因子挖掘路线
- 方法:让LLM直接在代码空间中生成Pandas/Numpy因子函数,构建LLM驱动的闭环式因子代码挖掘框架,通过执行反馈、错误修复、因子审查和工具函数沉淀,形成更接近真实研究员工作流的自动化因子研发过程。
- 结果:生成了80个低频量价因子,RankIC均值约为4.90%,ICIR均值约为0.66。因子内部相关性均值约为0.32,中位数约为0.30,约85.5%的因子对相关性低于0.50。相对Alpha158MLP,平均增量IC约为1.67%。
- 代表因子:volume_weighted_intraday_reversal_persistence(隔夜-日内修正)、volume_weighted_high_low_asymmetric_reversion(极值形成过程)、overnight_gap_volume_persistence(量能体制切换)等,体现了函数式路线对复杂交易行为的表达优势。
研究结论
- 两条路线均能生成具有统计有效性和增量信息的量价因子,并保留了与传统量价因子、Alpha158MLP合成因子之间的差异。
- LLM增强遗传编程路线在表达式空间中引入金融逻辑和进化搜索,能够发现兼具可解释性和实证有效性的量价结构。
- 函数式因子挖掘路线打开了更自由的因子表达空间,适合承载更具结构性的金融假设,并通过工具函数库沉淀为可复用的研究组件。
- 研究将因子挖掘流程进一步封装为【东吴金工】选股因子迭代Skill,使AI因子研究从单次结果生成走向可复盘、可继承、可共享的研究能力沉淀。
风险提示
- 模型失效风险、过拟合风险、极端行情风险、数据质量与评测口径风险、大语言模型生成风险、交易成本与流动性风险。