智能体观测
背景: 智能体应用的开发与部署过程中,请求调用路径复杂,难以追踪关键节点,导致问题定位困难、性能瓶颈难以发现。观测功能通过在请求处理的每个关键节点插入探针,自动采集处理时间、调用路径等信息,构建完整的调用链(Trace),并通过可视化界面展示,帮助开发者快速定位问题。
核心能力: 观测功能覆盖了以下几类关键数据,帮助开发者和运维人员全面掌握Agent的运行状态:
- Trace: 一次完整请求的全生命周期记录,呈现了从请求发起到最终返回结果的完整过程。
- Span: 在Trace中,每一个独立的操作步骤称为一个Span,比如一次模型调用或一个函数调用。
- 链路信息: 展示选中Span的输入与输出数据,帮助您追踪数据流转过程及排查调用错误。
- 元数据: 运行过程中的键值对集合,用于存储运行实例的补充信息。
- 标注: 附加在Span上的自定义信息,可以对Trace数据进行分类、筛选或标记特殊事件。
- 指标: 用于反映系统运行的宏观状态和性能健康度,常见类型包括Tokens消耗、请求数、错误数和平均响应时间。
- 日志: 展示当前Span在智能体运行过程中产生的事件记录,包含时间戳与详细内容。
应用场景:
- 模型调用链路优化: 通过调用链分析功能,查看每个Span的耗时,定位最长耗时的组件,从而进行优化。
- 模型输出不符合预期: 通过查看模型节点的Span详细信息,发现模型生成的参数错误,导致应用查询返回异常。
- Token消耗异常,成本飙升: 通过调用链分析发现模型反复调用高成本的长文本生成服务,通过增加上下文判断逻辑避免重复生成,并设置调用频率与Token阈值告警。
- 智能体评测: 通过观测功能收集特定场景下的Trace数据进行回流,用于构建评测集,通过评估结果识别高频问题,优化对应的问题以提升智能体响应的准确率。
数据上报:
- AgentArts智能体平台: 提供完善的可观测性能力,支持将智能体运行过程中的数据自动上报至运营运维平台。
- 高代码智能体: 支持将本地开发的智能体应用集成上报,实现运行数据的自动上报。
- 第三方智能体: 通过OpenTelemetry上报,实现智能体数据监控。
查看应用指标信息:
- 业务指标: 监测智能体的关键运行表现,如Tokens消耗、响应成功率、模型请求成功率、模型调用平均耗时等。
- 运营指标: 了解智能体应用的总数、新增数量、活跃数以及资源消耗情况。
查看应用调用链信息: 查看请求的完整调用链路,定位性能瓶颈或故障节点。
查看会话分析信息: 智能体与用户对话的历史数据,为优化对话逻辑与服务质量提供依据。
查看高代码应用运行数据: 查看高代码智能体的运行时信息、沙箱工具数据信息和网关数据信息。
查看第三方智能体上报的Trace、Metric数据: 在“调用链分析”和“Token分析”页签查看完整调用路径定位异常节点;在“指标分析”页签查看消耗排行。
人工标注Trace数据: 创建自定义标注,对调用链数据进行分类,快速定位问题、识别业务规律,有效提升业务评估与迭代效率。
数据回流: 将应用上线后、在真实场景下产生的Trace数据进行回流与标注,并将其沉淀到数据集中,为后续的模型评估与优化提供坚实基础。
智能体评估
背景: 随着大模型技术快速发展与广泛应用,智能体评估已成为AI应用开发的关键环节。AgentArts智能体平台引入了评估功能,内置可直接使用的评估器,支持快速构建评测集、配置评估器、执行评估任务并自动生成评估报告,大幅提升评估效率与客观性。
什么是评估: 对智能体表现进行系统化、自动化检验的过程。通过预设的评估标准,对输出质量、内容正确性、工具调用合理性等维度进行量化打分。
评估的两种方式:
- 离线评估: 应用在正式发布前,通过在各种预设场景下评估智能体的响应,确保其表现符合预期标准。
- 在线评估: 应用上线后,基于真实的运行数据(调用链、工具等)自动化对智能体产生的数据进行采样和评估。
评测集: 用于评估Agent回复效果的数据集,通常包含输入数据(input)和预期输出(reference_output)。
评估器: 评估过程中扮演着“裁判”的角色,通过量化分析Agent输出结果的准确性,或数据集本身质量。
执行评估任务: 创建评估任务,查看评估结果,对比评估任务结果,标注评估结果,评估结果回流。
核心观点: AgentArts观测和评估功能可以帮助开发者实现智能体运行的全程可观测性,量化评估智能体表现,并持续迭代优化智能体效果。