登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
多智能体强化学习大模型初探-郝晓田
文化传媒
2023-08-08
DataFunSummit2023:大模型与AIGC峰会
罗鑫涛Robin
多智能体决策大模型面临的挑战
基本概念
合作式多智能体系统
:多个参与主体合作优化目标函数,常见于游戏AI、智能仓储、车辆协调等场景。
合作式多智能体强化学习
:通过多智能体马尔可夫决策过程(MMDP)和去中心化部分可观测马尔可夫决策过程(Dec-POMDP)建模。
挑战
维度灾难
:状态观测空间和联合动作空间随实体数量指数增长。
学习样本效率低
。
通用性和泛化能力差
。
多智能体强化学习大模型及其优势
多智能体强化学习大模型
设计具有较好泛化性的模型,一个模型可以解决多个类似问题。
大模型带来的好处
在自然语言处理、计算机视觉等领域已取得突破性成果。
强化学习领域:通过更大、更好的模型提高性能并减少运行时间。
动作语义网络与置换不变性、置换同变性
动作语义网络(Action Semantics Network)
考虑不同动作对其他智能体的影响,设计基于动作语义的神经网络。
置换不变性与置换同变性
处理具有相同类型的智能体时,构建对实体顺序不敏感的函数,显著降低状态/观测空间维度。
动作分为实体相关(如攻击、治疗)和非实体相关(如移动)两类。
跨任务自动化课程学习
自动课程生成(PORTAL)
自适应选择任务以优化学习序列。
通过评估回报选择难度适中的任务,并基于任务相似度实现策略迁移。
实验结果
SMAC挑战
:实现了100%的胜率。
MPE和Google足球环境
:展示了不同场景下的应用效果。
总结
提供了简单但高效的置换不变性和置换同变性模块实现。
作为任何多智能体强化学习算法的插件模块,提升性能。
达到典型多智能体强化学习基准的最优结果。
你可能感兴趣
钱忱-大模型驱动的多智能体协同初探
信息技术
2024AI研发数字峰会AiDD北京站
2024-11-17
强化学习环境与科学中的强化学习:数据铸造厂与多智能体架构
信息技术
-
2026-01-07
多智能体合作强化学习中的通信
华威大学
2023-02-01
针对干扰攻击下的协作无人机中继网络的多智能体深度强化学习
信息技术
-
2026-01-08
针对指挥控制强化学习智能体的对抗攻击
-
2024-07-01
计算机行业周报:清华等机构开源强化学习框架RLinf,字节发布原生GUI智能体UI-TARS-2
信息技术
华鑫证券
2025-09-09
通信:“合成数据+强化学习”:大模型进化的新范式
信息技术
国盛证券
2024-09-19
AI系列深度11期:大模型如何进行模仿与强化学习?
文化传媒
东吴证券
2026-08-03
量化专题报告:“机器学习”选股模型系列研究(一)-量价指纹模型的构建与应用初探
国盛证券
2026-01-16
基于分钟数据的GRU模型在选股策略中的应用初探——德邦金工机器学习专题之六
德邦证券
2024-07-01