登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
金工专题报告:基于大模型外部评价体系框架介绍
2025-06-30
冯昱文,肖承志
中邮证券
,
大模型评价基准综述
主流大模型公司及代表模型众多,如OpenAI、Anthropic、Google、Meta等,模型评价与筛选成为重要工作。
常见大模型评价基准包括LiveCodeBench(代码能力)、AIME(数学与逻辑推理能力)、BFCL(函数与工具调用能力)。
大模型金融能力评价基准
金融领域评价基准相对缺乏,原因包括任务主观性、数据隐私、任务多样性、法律风险等。
主流金融领域基准包括FinanceBench(开放金融问答)、FinBen(多任务金融评估)。
大模型金融能力评价基准构建
构建专注于逻辑推理的金融问答评价基准,包含188道单项选择题,涵盖9个类别:金融相关计算、经济学、财务报表分析、公司金融、权益投资、固定收益、衍生品、另类投资、投资组合管理。
每道题目包含题目分类、题目、答案、推理过程(思维链)。
实验设计
实验场景:基准场景、思维链(CoT)场景、样本提示(few-shot)场景、样本提示+思维链场景。
数据集构建:样本提示集72道题目,测试集116道题目。
模型选择:DeepSeek-R1、DeepSeek-V3、HUNYUAN-T1、Qwen-max、DouBAO-seed-1.6-thinking、GLM-4-plus。
评测指标:准确率、Pass@K。
实验结论
对比实验:思维链提示显著提升模型准确率(最高提升超过15%),样本提示效果有限。
不同类别题目对比:大模型在金融相关计算、投资组合管理、另类投资类别中得分较高,经济学、财务报表分析类别中表现较差。
Pass@K评价标准:思维链提示下Pass@3概率达到0.8922,Pass@1指标较为严格。
大模型推理内容对比:模型在处理概念相近、存在逻辑陷阱的题目时容易出现理解偏差。
结语
大模型在金融知识获取与基础问答上表现不俗,但深度理解和复杂逻辑推理仍是挑战。
高质量数据是解锁模型深层能力的关键,思维链/推理线索或提示样本效果显著。
大模型不应替代人类思考,而应作为分析师可靠的辅助工具,需深入检验其背后的逻辑链条。
风险提示
基于历史数据分析,历史规律未来可能存在失效的风险。
案例仅供测试使用,不构成投资建议。
大模型回答存在幻觉现象与随机性,生成答案可能存在错误。
你可能感兴趣
金工专题报告:基于ChatGPT的基金评价探究
东吴证券
2023-02-17
金工专题报告:基于收益率的股基评价靠谱吗?
东吴证券
2018-07-29
债券银行系类货基系列专题之三:什么是好的货币基金?货币基金评价体系介绍
华创证券
2018-10-21
大模型赋能投研之二十:从金融文本数据到投研工作流:金融Skills体系介绍
金融
国金证券
2026-04-30
外部支持评价框架、差异解析与实践应用
远东资信
2026-04-20
政务大模型建设路径及评价体系研究报告
中国信通院
2024-01-02
2022年债券市场将增强稳经济作用 基于信用分层的风险评价体系逐渐形成
大公信用
2022-01-24
证券投资基金:新推基于基础资产分类的国信债基评价体系
国信证券
2013-02-07
蚂蚁集团:大模型应用可信框架助力企业构建可信 AI 体系
IDC
2025-12-11
国家电网:基于能源数据的典型行业碳资信评价体系及应用场景研究报告
电气设备
国网(苏州)城市能源研究院
2024-04-30