本文提出了一种融合贝叶斯神经网络(BNN)和Dirichlet分布策略的风险厌恶型强化学习算法,用于最优投资组合分配。核心观点包括:
-
算法框架:结合BNN和Dirichlet分布策略的强化学习框架,其中评价网络采用BNN估计行动值函数,并通过KL散度作为正则化项;策略网络通过Dirichlet分布策略实施,以探索不同的行动选择。
-
风险规避特性:通过引入KL散度作为正则化项,衡量后验分布与近似器之间的差异;采用Dirichlet策略解决深度确定性策略梯度模型(DDPG)在受限行动空间上的问题;引入风险价值(VaR)作为风险度量,通过惩罚机制调整策略网络,确保在不确定环境中做出稳健决策。
-
实证结果:与其他强化学习算法(如PPO、TRPO)及启发式金融投资组合选择理论进行比较,在1000步(天)的测试期间,本文的算法大多数时候表现更佳,盈利能力更强。模型在股票、商品和加密货币市场数据集上均表现出竞争力。
-
关键数据:风险厌恶型模型的平均奖励虽有所下降,但奖励的标准差显著降低(降低18%),符合有效前沿的相关性。
-
研究结论:传统的金融方法在特定背景下可能不可行,而本文提出的风险厌恶型强化学习算法在训练中成功控制了风险,为最优投资组合分配提供了新的解决方案。
风险提示:文献结论基于历史数据与海外文献进行总结,不构成任何投资建议。