登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
金工专题报告:Deepseek背景综述及在金融领域应用场景初探
2025-02-24
肖承志,冯昱文
中邮证券
Daisy.Aldrich
DeepSeek背景介绍
DeepSeek-R1模型上线后用户增长迅速,截至2025年1月31日日活跃用户突破2000万,成为国产日活用户最多的大模型,也是全球用户增长最快的AI产品。
DeepSeek公司成立于2023年,发展迅速,推出了DeepSeekLLM、DeepSeek-V2、DeepSeek-V3等产品,并在2025年1月上线DeepSeek-R1。
DeepSeek的重要研究成果包括《DeepSeekLLM:ScalingOpen-SourceLanguageModelswithLongtermism》、《DeepSeek-V2:AStrong,Economical,andEfficientMixture-of-ExpertsLanguageModel》、《DeepSeek-V3TechnicalReport》以及《DeepSeek-R1:IncentivizingReasoningCapabilityinLLMisviaReinforcementLearning》。
DeepSeekLLM
DeepSeekLLM模型发布于2024年1月,涵盖模型训练、缩放定律研究、对齐优化及评估等工作。
扩展法则(ScalingLaws):研究表明数据质量在模型和数据的最优扩展分配策略中起着关键作用,高质量数据会使增加的计算预算更多地向模型扩展倾斜。
DeepSeek-V2
主要介绍了DeepSeek-V2这一强大的混合专家(MoE)语言模型,设计了创新架构:采用Transformer架构,设计Multi-headLatentAttention(MLA)。
MLA与MHA对比:MLA在性能表现上优于MHA,并且在减少KV缓存数量方面效果显著。
混合专家模式(MoE):整合多个“专家”模型的输出,增强整体模型的性能表现,拓展模型容量,让模型更“专业”,实现稀疏激活。
算法GroupRelativePolicyOptimization(GRPO):舍弃传统的Critic模型,节省训练过程中的开销。
DeepSeek-V3
介绍了DeepSeek-V3这一具有6710亿参数的混合专家语言模型,主要围绕模型架构、训练、评估及应用等方面展开研究。
多令牌预测(MTP):通过促使模型在每个位置对多个未来令牌进行预测,提升模型的性能表现。
FP8混合精度训练框架:通过降低数据精度来提升计算效率、减少内存占用和降低训练成本,同时尽量保持模型的性能和准确性。
DeepSeek-R1
主要介绍了DeepSeek-R1和DeepSeek-R1-Zero这两个推理模型,展示了通过强化学习提升语言模型推理能力的研究成果。
Self-evolutionProcessofDeepSeek-R1-ZeroandAhaMoment:DeepSeek-R1-Zero模型的推理能力提升是通过强化学习,模型自己学会的,投入了更多“思考时间”,掌握了通过延长测试时计算的方式去处理日益复杂的推理任务。
冷启动(ColdStart):为了解决DeepSeek-R1-Zero模型在训练初期时稳定性差的问题,引入了“冷启动数据”,为模型提供了一系列高质量的“范例”。
DeepSeek-R1训练成本对比
DeepSeek-R1能够在极低训练成本下实现与ChatGPT-o1相当的性能,主要依赖于其创新的训练算法设计、硬件优化的注意力机制以及高效的数据利用策略。
与传统大模型对比,DeepSeek-R1在训练算法、计算资源、显存占用、数据依赖、数据成本、训练精度、训练架构、MoE\激活参数量等方面均有优势。
DeepSeek使用入门
DeepSeek-R1常见访问途径:DeepSeek官方、国家超算互联网平台、腾讯元宝、火山方舟、跃问、MiniMaxChat、Ima.copilot、Perplexity.ai、OpenRouter.ai、QuoraPoe等。
如何使用APIkey访问DeepSeek模型:以腾讯云与CherryStudio为例,介绍了利用API调用DeepSeek模型的流程。
DeepSeek在普通人投资场景下的实例分析
利用DeepSeek了解自己的风险偏好:通过对话测试的方式协助投资人了解自己的风险偏好。
利用DeepSeek找到适合自己的投资组合:通过清晰描述自己的情况,让deepseek提供更具体的投资建议,包括具体的大类资产选择、具体标的选择,到投资策略构建、策略动态调整,再到风险控制与执行阶段建议。
利用DeepSeek了解金融产品:快速了解金融产品,如基金的成本、风险类别、基金特点以及适合人群等。
利用deepseek学习投资策略,并使用策略优化现有组合:辅助进行投资选择,如核心-卫星策略、CPPI策略、杠铃策略、定投策略、再平衡策略、风险评价策略、美林时钟策略、耶鲁模型、网格交易法等。
利用deepseek辅助读懂公司报告:辅助读取上市公司年报等报告。
逆向思维,让DeepSeek点评自己给出的答案,二次检验DeepSeek回答质量:采用逆向思维,在DeepSeek给出回答后,让它对自己刚刚给出的答案进行评价,以达到二次检验以及拓宽问题视角的目的。
展望
大模型与金融工作的结合领域依旧是一片亟需开拓的蓝海,需要对于大模型本身的理解足够深入,也要对现有的业务有着敏锐的洞察力。
专业数据的问题,一方面是因为DeepSeek等大模型是通用类或逻辑类大模型,并不是应用于金融领域的专业小模型;另一方面,大模型擅长处理非结构化数据(文本、图片)而非金融工作中常用到的结构化数据。
将大模型的逻辑推理能力、高维能力等与工程化项目相结合也是未来具有潜力的研究方向。
风险提示
本报告基于历史数据分析,历史规律未来可能存在失效的风险。
本报告中的案例仅供测试使用,不构成投资建议。
DeepSeek回答存在幻觉现象与随机性,生成答案可能存在错误。
你可能感兴趣
DeepSeek在教育和学术领域的应用场景与案例(中)
信息技术
北京大学
2025-05-21
DeepSeek在教育和学术领域的应用场景与案例(上)
信息技术
北大青鸟人工智能研究院&北大计算机学院元宇宙技术研究所&北大教育学院学习科学实验室
2025-05-20
Deepseek在药企研发领域的本地化部署和应用场景
医药生物
智慧芽
2025-03-01
DeepSeek在教育和学术领域的应用场景与案例(下)
信息技术
北大青鸟人工智能研究院&北大计算机学院元宇宙技术研究所&北大教育学院学习科学实验室
2025-05-22
DeepSeek在教育和学术领域的应用场景与案例
北大青鸟人工智能研究院&北大计算机学院元宇宙技术研究所&北大教育学院学习科学实验室
2025-05-22
2025年Deepseek在药企研发领域的本地化部署和应用场景
医药生物
智慧芽
2025-04-01
华创金工CTA系列专题报告(二):持仓博弈异常信号在金融期货上的应用
华创证券
2018-07-09
大语言模型在投研中的应用:DeepSeek、QwQ-32B与Manus技术解析、投研场景与量化应用
太平洋证券
2025-03-15
基于分钟数据的GRU模型在选股策略中的应用初探——德邦金工机器学习专题之六
德邦证券
2024-07-01
DeepSeek 在财务智能运营场景中的应用
信息技术
中兴新云
2025-05-26