智能体观测
AgentArts平台提供全面的智能体观测功能,帮助开发者了解智能体运行状态,快速定位问题并进行优化。观测功能覆盖以下几类关键数据:
- 智能体概览:展示关键业务指标,如Tokens消耗、Trace数、响应成功率等,帮助开发者监测关键业务表现。
- 运营指标:聚焦用户使用行为与资源运行情况,提供多维度、可量化、可追踪的运营视图。
- 调用链分析:记录请求从发起到响应的完整路径,展示各组件的调用顺序、耗时与状态,快速定位性能瓶颈与异常调用。
- 会话分析:记录用户与系统的交互过程信息,深入理解用户行为,提升体验流畅度。
- 智能体运行分析:展示高代码智能体的运行状态、更新时间及详细日志,辅助追踪执行流程。
- 沙箱工具:展示沙箱工具调用过程中的日志信息,用于排查工具执行异常。
- 网关:展示网关在使用过程中产生的日志信息。
智能体评估
AgentArts平台提供智能体评估功能,帮助开发者量化评估智能体表现,并为后续优化提供依据。评估功能覆盖以下几类关键评估器:
- 正确性:评估智能体的输出是否正确、准确、真实,并完整覆盖核心要点。
- AI味检查:评估模型回复中是否存在开头结尾话术冗余、连接词模板化、人物名称简单化、语气词过多等问题。
- 任务完成度:通过比对用户输入与Agent输出,判断任务是否成功完成。
- 轨迹质量:分析Agent的内部轨迹,评估其逻辑连贯性、是否有清晰的进展过程和目标达成情况。
- 不敏感性:评估模型输出是否对特定社会群体表现出偏见、刻板印象或文化不敏感。
- 争议性:判断模型对用户输入的回复是否保持了客观、中立、无争议。
- 创意性:评估提交的内容是否表现出新颖性或独特的想法。
- 参考答案遵从度:判断AI回答是否在关键要点上与标准答案实质一致。
- 工具参数正确性:判断生成的调用是否从问题中提取了完全正确的参数。
- 工具选择质量:评估AI选择的工具是否合法、功能匹配、无虚构。
- 幻觉现象:评估模型输出是否存在幻觉现象。
- 性别歧视:评估模型输出是否带有性别歧视。
- 恶意性:评估模型输出是否存在恶意意图及潜在的社会危害。
- 指令遵从度:判断AI助手生成的回答是否严格遵循了系统或用户的提示指令。
- 拒答检测:衡量模型能否判断提问文本是否违反了社会行为准则而应该被拒绝。
- 格式检查:对模型回复中序号、引用、角标、上标、符号规范及排版逻辑的错误检查。
- 语种一致性:衡量回复文本所使用的语言是否与提问文本的语言一致。
- 文本可用性:综合衡量一篇文本在完成既定任务目标、符合体裁规范、可读可信,并具备有效表达与价值输出方面的整体可用性。
- 安全风险漏放:结合提问和回答,判断模型回复是否存在政治敏感、色情、违法、公序良俗等风险。
- 有害性:评估模型输出是否存在有害、冒犯或不恰当的内容。
- 有用性:评估模型输出对于用户输入是否具有高有用性、深刻洞察力且符合恰当性标准。
- 深度性:评估提交的内容是否体现了思想的深度,涵盖逻辑推演、多维视角及批判性思维。
- 犯罪性:评估模型输出是否包含诱发、指导或支持现实世界中非法行为的内容。
- 引用相关性:衡量回复文本是否引用了文本中的真实引用,评估引语的真实性、措辞准确性及归属正确性。
- 知识问答-指令遵循:考察AI模型是否全面、准确地理解并执行了用户在指令中提出的所有需求。
- 知识问答-真实准确:评估客观类事实真实性,时效性,计算的准确性,知识的正确性。
- 知识问答-精炼性:评估回复内容的精炼程度,检查是否存在语义重复、结构冗余或无关的社交废话。
- 知识问答-便捷性:考察回复的结构组织是否合理,核心答案是否突出且便于快速阅读。
- 知识问答-丰富度:考察模型回复的丰富度和特异性,识别并剥离冗余套话,评估核心信息、支撑证据及延展知识的厚度。
- 简洁性:评估输出内容是否简洁,识别并剔除文本中的装饰性词汇、礼貌用语及不必要的背景铺垫。
- 细节丰富度:检查输出内容是否表现出关注细节。
- 轨迹-工具参数填充正确性:评测Agent运行轨迹中,所有工具的定义与调用参数,判断工具参数填充是否完整,参数的数据类型正确,且没有幻觉入参。
- 轮次相关性:评估多轮对话中每一轮AI回复是否与上下文相关。
- 知识保持:评估多轮对话中LLM是否记住并正确使用之前对话中用户提供的信息。
- 对话完整性:评估多轮对话中LLM是否完整满足了用户的所有意图。
- 文本等值判断:检查文本输出是否完全匹配。
- 文本包含判断:检查文本输出是否包含子字符串(多个字符串间逗号分隔)。
- 文本正则匹配:检查文本输出与正则表达式是否匹配。
- 文本起始子串判断:评估智能体的输出是否以特定字符串开头。
- 文本JSON格式校验:检查智能体的输出的文本是否是有效的JSON格式。
- 数学表达式相等判断:检查智能体输出的数学表达式数学含义是否完全相等。
- JSON相等判断:检查两个JSON对象是否完全相等。
评测集
AgentArts平台支持创建评测集,用于评估智能体回复效果。评测集可以手动创建或通过AI合成,并支持添加自定义配置列,以满足不同评估需求。
评估任务
AgentArts平台支持创建评估任务,对智能体或评测集进行评估。评估任务可以设置为离线评估或在线评估,并支持选择不同的评估器和评估粒度。
总结
AgentArts平台提供全面的智能体观测和评估功能,帮助开发者了解智能体运行状态,量化评估智能体表现,并为后续优化提供依据。通过使用AgentArts平台,开发者可以更高效地开发和管理智能体,提升智能体应用的质量和用户体验。