DeepSeek V4 Pro的核心功能是提升Agent在生产环境中的执行能力,并通过Harness开放平台增强模型与业务工具的协同效率。它采用MoE架构,总参数达1.6T,支持100万Token上下文,在多个测试中表现优异,如HLE工具增强提升24.5%,TerminalBench2.1提升21.9%等。
金融领域大模型正朝着提升Agent执行能力和工具协同效率的方向发展。DeepSeek V4 Pro通过Harness平台展示了模型与业务工具结合的潜力,未来可能更多模型会强化与金融业务系统的对接,提升自动化和智能化水平。
报告重点评测了DeepSeek V4 Pro在估值、回测和行业研究三个任务中的表现。结果显示V4 Pro在回测和行业研究任务中表现最佳,Kimi K3在估值任务中领先,而GLM-5.2在三项任务中均排名靠后。评测还关注了预测颗粒度、Excel公式准确性、交易时点处理等细节。
当前大模型市场以MoE架构和开放平台为特点,各家模型在特定任务上各有优势。例如DeepSeek V4 Pro在回测和行业研究任务中表现突出,Kimi K3在估值任务中领先。市场普遍关注模型的可解释性、成本效益和与现有业务系统的兼容性。
本报告提示的风险包括模型预测方法的颗粒度问题、Excel公式可能存在的系统性错位、交易时点与成本处理的复杂性,以及知识库来源追溯的难度。这些是当前大模型应用中普遍存在的挑战,需要持续优化和改进。