大语言模型驱动因子挖掘的模型演进与框架梳理 报告发布日期 ——量化研究参考系列之九 刘静涵执业证书编号:S0860520080003香港证监会牌照:BSX840liujinghan@orientsec.com.cn021-63326320 研究结论 ⚫文献信息:本文系统梳理海内外金融工程与AI量化相关学术文献,分析大语言模型驱动因子挖掘的历史演进脉络,将其划分为七个发展阶段,依次为理论因子、公式化Alpha、传统自动搜索、LLM直接生成、文本Alpha与另类数据、知识增强与Agent闭环、全栈投研与评估治理,囊括AutoAlpha、Alpha-GPT、FAMA、R&D-Agent-Quant、AlphaCrafter、QuantaAlpha等海内外主流因子挖掘框架。 ⚫推荐理由:LLM驱动的因子挖掘是传统量化投研体系的升级,依托大模型打通金融语义理解、代码开发、工具调用、回测反馈与研究记忆全链路,推动因子研发由单点公式生成升级为全实验流程闭环;研究重心逐步从单一因子挖掘,延伸至文本另类Alpha开发、Agent闭环投研、大模型与进化搜索融合、全栈自动化投研系统建设,显著压缩了因子的研发周期、打通文本数据与量价数据,并推动因子全生命周期管理逐步标准化。 ⚫技术演进:大语言模型驱动因子挖掘的历史可划分为七个阶段。1)理论因子阶段:以CAPM、Fama-French等框架解释收益来源,形成量化投资的经济逻辑基础。2)公式化Alpha阶段:将投资假设转化为标准化字段、算子和表达式,建立可计算、可回测的因子生产范式。3)传统自动搜索阶段:通过遗传规划、强化学习等方法批量扩展候选因子,提高初筛效率,但仍存在解释性弱、重复率高和过拟合问题。4)LLM直接生成阶段:将自然语言投研思路转化为因子定义、公式草案和代码框架,降低研究想法到可执行候选的转换成本。5)文本Alpha与另类数据阶段:把公告、新闻等非结构化信息转化为可回测标签,拓展因子信息来源。6)知识增强与Agent闭环阶段:接入论文库、研报库、历史因子库和实验日志,打通假设生成、回测诊断、失败复盘与迭代优化。7)全栈投研与评估治理阶段:能力延伸至因子筛选、组合构建、交易成本、风控与审计,推动自动化投研从“能生成”走向“可验证、可落地”。 ⚫落地建议:机构落地应遵循“底层标准化、分阶段迭代、多层质控”的路径,逐步接入既有投研体系。1)标准化底层生产环境:优先统一因子计算接口、字段口径和时间对齐规则,搭建独立沙箱回测环境,并划定代码执行权限与边界;在该阶段,LLM主要承担研报拆解、逻辑抽取、公式草案和代码初稿生成,所有输出需经过字段校验、代码检查、人工复核和样本外回测后,方可进入候选池。2)从知识复用走向流程闭环:流程跑通后,接入白名单知识库,整合研报、论文、历史因子库、失败实验复盘和标准字段释义,推动模型从开放式自由生成转向知识增强生成。3)搭建多层质控体系:在批量生成能力形成后,前置设置基础量化初筛、人工逻辑复核和多场景压力测试,重点检验覆盖率、换手率、样本外IC衰减、成本后收益、相关性去重和风格暴露;待因子端稳定贡献增量后,再逐步试点Agent闭环和组合层权限,并保留人工审批、风控隔离和审计留痕机制。 风险提示 1.模型幻觉和代码错误风险:LLM可能生成不存在的字段、不可执行代码或逻辑上不成立的因子解释,若缺少DSL、测试和人工复核,可能影响研究结论。2.数据泄漏和前视偏差风险:研报、公告、新闻和财务数据若缺少point-in-time记录,模型检索和回测过程可能引入未来信息,导致样本内表现被高估。3.因子拥挤和过拟合风险:自动生成候选数量增加后,重复信号、拥挤交易和样本内过拟合风险同步上升,实盘表现可能低于回测结果。4.合规与权限风险:内部研报、交易日志、客户数据和研究纪要存在权限边界,模型接入和知识库建设需要满足数据脱敏、访问控制和审计留痕要求。5.成本和落地不及预期风险:模型调用、向量库、重排、私有化部署和人工复核均会带来持续成本,实际节省的人力和新增因子收益可能低于预期。 目录 1、文献概况:因子挖掘从理论因子走向Agent闭环.....................................4 2、推荐理由:LLM实现因子挖掘从降本增效到流程重塑..............................4 2.1压缩“想法—表达式—代码”链条....................................................................................42.2将文本信息纳入可回测变量体系...................................................................................52.3推动候选因子进入生命周期管理...................................................................................5 3、技术演进、模式分化与生产化约束...........................................................6 3.1阶段一:理论因子,解释收益来源并形成理论基础......................................................63.2阶段二:公式化Alpha,把投资逻辑转为标准表达式...................................................63.3阶段三:传统自动搜索,在算子空间中批量扩展候选...................................................73.4阶段四:LLM直接生成,把研究语言转为公式或代码草案...........................................73.5阶段五:文本Alpha与另类数据,把非结构化信息转为信号........................................83.6阶段六:知识增强与Agent闭环,复用历史研究并持续迭代.......................................83.7阶段七:全栈投研Agent与评估治理,延伸到组合、交易和审计................................93.8模式取舍与生产化约束...............................................................................................10 4、落地建议:底层标准化、分阶段迭代、多层质控...................................11 4.1标准化底层生产环境,精细化提示词工程管控...........................................................114.2分阶段迭代落地,从知识复用到全流程闭环...............................................................124.3搭建多层质控体系,规避因子规模化质量稀释...........................................................12 5、结论......................................................................................................12 6、风险提示...............................................................................................12 7、参考文献...............................................................................................13 图表目录 图1:不同因子挖掘方式的业务维度对比....................................................................................6图2:因子挖掘方法的历史演进主线..........................................................................................10 量化投资行业前沿理论与技术迭代提速,海外顶尖量化研究成果中蕴藏着诸多可借鉴的新思路、新框架,为A股量化因子挖掘与策略研发提供重要参考。为此,我们推出量化研究参考系列报告,聚焦海外顶刊、预印本平台发布的量化领域前沿文献,通过深度拆解核心逻辑、实证结果与创新价值,结合A股市场特性及本土投研实践开展适配性分析,提炼可落地的优化方向与应用思路,为投资者提供专业、前沿的研究参考。本期为系列第九篇,系统梳理海内外量化与AI金融领域相关文献,分析大语言模型驱动因子挖掘的历史演进脉络,将其划分为七个发展阶段,并结合A股市场特性提炼可落地的机构实践建议。 1、文献概况:因子挖掘从理论因子走向Agent闭环 本文通过梳理海内外量化与AI金融领域相关文献,发现行业技术演进呈现出清晰的时间脉络。在经济与金融领域的学术研究奠定了因子挖掘的理论基础后,2016年《101 Formulaic Alphas》落 地 , 确 立 标 准 化 公 式 表 达 范 式 , 为 机 器 自 动 挖 掘 因 子 奠 定 统 一 语 法 ;2020-2024年 ,AutoAlpha、AlphaGen、Alpha²、RiskMiner等成果落地,遗传规划、强化学习、蒙特卡洛树搜索 、GFlowNet等 算 法 被 批 量 应 用 于 公 式 空 间 自 动 化 遍 历 ;2023年 起 ,BloombergGPT、FinGPT、FinMem、Alpha-GPT、GPT-Signal等金融大模型相关研究落地,自然语言正式介入因子 创 意 构 思 、 代 码 开 发 与 投 研 辅 助 工 作 ;2024-2026年 ,FAMA、FactorMiner、Hubble、QuantaAlpha、R&D-Agent-Quant、AlphaCrafter等研究聚焦Agent自动化闭环、大模型与进化算法融合、全链路智能投研系统开发。 按研究主题划分,现有文献可归纳为五大方向:第一类为经典资产定价与基本面因子研究,为量化因子提供底层经济逻辑支撑;第二类聚焦公式化Alpha与传统算法自动挖因子,搭建机器批量生成、回测入库的标准化规则;第三类围绕金融LLM与大模型直生成因子,解决自然语言投研思路向计算公式、可运行代码的转化难题;第四类主攻文本与另类数据Alpha,依托非结构化信息(新闻、公告、研报、社交媒体、链上数据)提炼超额收益信号;第五类着眼Agent闭环研发、多算法融合与全流程评估治理,探索自动化投研系统可持续、可复盘、合规落地的实现路径。 基于上述文献脉络,本文跳出“LLM仅用来生成因子公式”的片面认知,将大模型因子挖掘置于量化自动化长线演进中分析:早期研究解决因子定义与标准化表达,中期算法研究优化因子搜索效率,而LLM相关研究的核心增量,是串联金融语义理解、代码落地、工具调用、回测反馈与历史经验存储,完善全链条投研链路。 2、推荐理由:LLM实现因子挖掘从降本增效到流程重塑 从投研流程看,LLM因子挖掘的价值不只在于提高候选因子产出速度,更在于压缩研发周期、打通文本数据与量价数据,