核心观点
基于大型语言模型(LLM)的智能体标志着从被动问答到主动任务完成的转变:它们感知环境、调用工具、维护状态,并在长期范围内采取行动。随着智能体系统从提示工程发展到工作流和上下文工程、 harness 工程和智能体原生训练与协同进化,一个核心问题变得越来越重要:智能体性能的瓶颈在哪里——是在基础模型、执行 harness,还是它们之间的耦合?
关键数据和研究结论
- 模型规模扩展的局限性:随着模型规模的增加,模型能力的提升越来越昂贵,且收益不均。在 MMLU 和 GPQA Diamond 等基准测试中,最新的 GPT、Claude 和 Gemini 模型在接近饱和的高分范围内聚集,使得后续改进的区分度降低。
- 智能体工程范式转变:智能体工程经历了四个范式转变:
- 提示工程:优化发送到模型的单次指令。例如,少样本示例、思维链推理、自洽性和树状思维搜索等技术可以澄清任务、约束输出格式并引出模型的潜在能力。
- 工作流和上下文工程:将优化单元从单个提示转变为围绕多步执行的信息生命周期。其核心学科是管理进入模型上下文窗口的信息,包括检索增强生成、长期记忆管理、工具和 API 定义以及渐进式技能披露。
- Harness 工程:关闭反馈驱动的执行循环。它将整个运行时基础设施视为主要设计对象,管理执行沙盒、状态检查点、验证循环、错误恢复和子代理协调。
- 智能体原生训练和协同进化:在可组合的、可学习的运行时之上构建,其一是将规划、工具使用、验证和恢复等智能体行为通过交互式环境训练成模型参数;其二是模型、harness 和更新策略在部署过程中都会发生变化,使用执行反馈来决定要保留、修改或撤销哪些更改。
- 执行 Harness 的分解:执行 harness 被分解为六个耦合的运行时职责:观察、上下文、控制、行动、状态和验证/治理。
- 任务属性与 Harness 配置:任务结构决定了执行 harness 的哪些部分成为性能关键。例如,软件工程任务主要受验证和治理的影响;网络/GUI 交互主要受 grounding 的影响;科学研究任务主要受综合的影响;医疗应用主要受安全性的影响;而具身智能体主要受控制的影响。
- 评估:评估使模型-harness 交互直接可见。基准测试分数应被视为模型-harness 配对的结果。评估维度应超越任务成功,包括可靠性、效率、延迟、安全性和过程质量。
未来方向
- 价值感知评估:考虑成功、成本、延迟和安全。
- 智能体原生训练:超越规划和工具使用,转向验证和恢复。
- Harness 设计:使基础模型适应特定于任务的工具、上下文和约束。