本文研究了无人机网络在对抗环境中的通信中继问题,提出了一种基于多智能体强化学习(MARL)的解决方案,旨在同时优化系统吞吐量、碰撞避免和抗干扰能力。文章首先指出现有研究的局限性,即通常将问题分解为独立的子问题,忽略了智能体物理位置、资源分配和网络频谱弹性的深度耦合性。为此,本文将问题建模为合作式MARL问题,采用集中式训练与分散式执行(CTDE)框架进行求解。
文章的核心观点在于,无人机网络的弹性关键在于学习最优的行为策略而非寻找最优的位置。通过MARL框架,无人机被建模为智能体团队,学习在实时环境反馈下动态协调网络性能和生存能力。CTDE架构允许团队在离线训练阶段利用全局信息学习复杂的合作策略,而在部署阶段仅基于本地观察执行动作,无需高带宽的智能体间通信。
主要贡献包括:
- 提出了一种综合MARL模型,将吞吐量最大化、碰撞避免和抗干扰能力整合到统一的奖励结构中。
- 设计并实现了基于CTDE的学习框架,采用集中式评价器和分散式执行器,学习复杂的资源分配和时空定位策略。
- 通过仿真实验验证了所提方法的有效性,结果表明智能体能够学习到自发的抗干扰策略,并有效平衡吞吐量和安全性,系统吞吐量提升约50%,碰撞率接近零。
研究结论表明,本文提出的MARL框架能够显著优于启发式基线方法,并展现出智能体在优化多目标奖励函数过程中自发生成抗干扰策略的能力,即通过适度冒险(增加与干扰器的距离)来换取更高的通信性能。实验结果验证了该方法在真实战术环境中的可行性和优越性,为未来无人机网络的弹性通信中继提供了新的思路。