智能语音助手的变革
智能语音助手的核心链路包括理解意图、分类与实体识别、执行话术与功能调用、决策任务拆解与接口选择。Agent技术为语音助手带来新机遇,通过大幅精简架构(从多层分类简化为一个模型,将80余个垂域简化为10个垂直Agent)和策略(去除大量文法、规则、模板,由人力驱动转向数据驱动),提升效率。
Agent技术在小爱中的成功实践
Agent技术在语音助手中的应用面临若干挑战,包括如何在语义理解中发挥Agent Planning、如何让Agent在交互中不断优化、如何让Agent掌握各类功能使用方式以及如何保证Agent的响应速度。
语义理解与Planning能力的结合
传统语义理解是判别任务,无法发挥Agent规划潜力。代码式语义表示与人类语言相当,发挥LLM在推理规划中的优势,基于定义的动作与实体自由组合意图表示,并根据Instruction输出Code。
提升Agent在垂直场景中的表现
垂直场景中包含多种功能与参数。通过大规模业务数据上的无监督训练(持续预训练)和少量微调(精细化微调),补充业务知识、熟悉业务定义,快速适应不同场景业务需求。持续预训练可显著提升模型效果,分阶段微调从易到难逐步学习。
Agent在与用户交互中成长
基于用户反馈迭代的强化学习链路显著改善意向性、歧义性问题。语音助手场景中的环境反馈帮助Agent优化。
提升Agent服务响应速度
通过压缩Prompt、业务定制投机采样、模型量化等方法提升响应速度,在保证效果的同时保持良好的产品体验。
Agent视角下的语音助手升级
Agent视角下的语音助手更加通用,具备更强的泛化能力,善于解决复杂长尾问题,端到端减少策略、模块堆叠,提升迭代效率与维护性。数据驱动各业务统一优化范式,基于数据飞轮持续迭代。
Agent升级带来的体验提升
单指令 -> 多指令(提升76%)、精准指令 -> 表达需求(提升67%)、简单任务 -> 复杂任务(提升73%)、平铺直叙 -> 逻辑关系(提升71%)。
未来优化方向
未来希望小爱具备主动交互的能力,主动向用户确认信息、根据用户行为习惯为其推荐执行操作。融合多模态能力,实现深度操控,如点外卖、打电话、打车等场景。
Agent技术加持的智能语音助手
采用代码式语义理解、多Agent协同架构,基于用户反馈的强化学习不断优化Agent,通过持续预训练与精细化微调掌握各类功能使用方式,在序列压缩、解码提效、模型压缩方向提升速度。未来方向包括更加主动智能的交互体验和结合多模态信息的深度理解与控制。