登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
强化学习环境与科学中的强化学习:数据铸造厂与多智能体架构
信息技术
2026-01-07
-
-
🌱
核心观点与关键数据
强化学习(RL)扩展是解锁 AI 能力的关键路径
:过去几个月验证了扩展 RL 计算能力的有效性,OpenAI 通过持续优化 RL 计算实现了模型性能提升。
数据规模化是扩展 RL 的主要挑战
:与预训练利用整个互联网数据不同,RL 需要构建专门的语料库,任务和数据的聚合是关键。
评估体系转向实用性与能力
:OpenAI 的 GDPval 评测涵盖 44 个职业、1000 多项任务,衡量模型在实际工作中的表现,GPT-5.2 胜率约为 71%。
环境构建是数据规模化的重要环节
:超过 35 家公司专注于构建 RL 环境,包括克隆网站、模拟软件平台等,编程环境需求最高。
数据铸造厂与专家外包
:实验室通过外包公司构建环境和任务,Mercor、Surge 等公司提供领域专家服务,收入主要集中在西方实验室。
强化学习即服务(RLaaS)
:初创公司提供定制化 RL 服务,OpenAI 和 Anthropic 也加入竞争,企业级需求推动市场发展。
面向科学的强化学习
:模型可用于搜索、规划、执行实验,Periodic Labs 构建自动化实验室生成数据,Medra 提供生物学数据。
多智能体架构
:GPT-5.2 Pro、Gemini Deep Think 等采用多智能体架构协同解决问题,OpenAI 是该领域的领导者。
研究结论
模型能力提升依赖于 RL 计算扩展和数据规模化
:实验室通过购买环境、外包数据和构建任务提升模型性能。
任务增强而非自动化是短期趋势
:模型主要增强人类工作,而非完全自动化,例如软件工程和放射学领域。
生物学领域挑战与机遇并存
:实验时间长、数据稀疏,但开源数据和制药公司合作提供机遇。
多智能体架构潜力巨大
:通过协同合作,LLM 能力将进一步提升,解决更大型项目。
实验室采购模式
Anthropic
:积极购买环境,打造供应商生态,关注编程、计算机使用和生物学等领域。
OpenAI
:采购环境,组建内部数据团队,通过 RFT 服务提供定制化模型。
Google DeepMind
:采购环境,利用自身平台优势,关注编程和计算机使用领域。
你可能感兴趣
多智能体合作强化学习中的通信
华威大学
2023-02-01
针对干扰攻击下的协作无人机中继网络的多智能体深度强化学习
信息技术
-
2026-01-08
多智能体强化学习大模型初探-郝晓田
文化传媒
DataFunSummit2023:大模型与AIGC峰会
2023-08-08
针对指挥控制强化学习智能体的对抗攻击
-
2024-07-01
极客时间企业版企业级多智能体架构搭建与应用能力·人才培养项目
极客时间
2026-05-14
1-2 个性化强化学习技术在京东新品流量分发系统中的实践与应用
文化传媒
DataFunSummit2022:决策智能在线峰会
2022-11-02
人工智能与宏观经济建模:RBC模型中的深度强化学习
信息技术
国际货币基金组织
2023-02-01
人工智能在作战决策中的应用:基于强化学习与图神经网络的武器目标分配
信息技术
首尔国立大学&韩华海洋
2025-03-04
人工智能与宏观经济建模:在RBC模型中的深度强化学习
国际货币基金组织
2023-02-24
公共部门AI智能体架构设计:面向技术负责人的变革性多智能体平台详解指南
信息技术
Capgemini
2025-10-29