浙江大学人工智能教育教学研究中心的张圣宇在2025年4月的研报中探讨了大小模型端云协同赋能人机交互的潜力。
大模型发展趋势与挑战
- 乔布斯发布第一代iPhone标志着移动互联网的黄金时代,而ChatGPT的出现则开启了“人工智能的iPhone时刻”。
- DeepSeek通过系统级创新打破了大语言模型以大算力为核心的预期天花板,为小资源环境下的通用人工智能探索了新道路。
- 大模型在移动端部署面临算力、带宽、电量和内存等限制,而现有知识迁移方法(如知识蒸馏、迁移学习)要求端云具有相似的任务类型或模型架构,难以应用于跨异构模型、任务和模态的异构知识迁移场景。
大小模型端云协同机制
- 端云协同(Device-Cloud Collaboration)指边缘设备模型和云侧服务器模型协同进化推断,云侧大模型负责通用认知计算,终端小模型负责实时感知和响应。
- 端云协同通过卸载部分学习任务至端侧,发挥终端靠近用户和数据源的天然优势,降低服务延时至毫秒级,增强模型个性化精准推理能力,缓解云服务器中心负载压力,同时支持用户原始数据在设备本地处理,有效克服主流云学习范式在实时性、个性化、负载成本、隐私安全等方面的不足。
- 大小模型端云协同可分解为大小模型协同和端云高效协同两部分,其中大小模型协同基础算法研究包括基于调度的协同、基于反馈的协同和基于生成的协同,而端云高效协同则涉及混合AI、端云异构模型知识互迁与协同推断等。
关键研究与创新
- 基于生成的协同:大模型驱动的小模型生成框架ModelGPT能够根据用户需求快速生成定制好的人工智能模型,在NLP、CV和Tabular Data典型数据集上进行验证,性能超越Finetune方法,且生成速度比至多先前范式(例如全参数微调、LORA微调)快270倍。
- 跨越异构模型、任务、模态的统一模型知识迁移框架MergeNet:通过异构模型知识表示和异构知识适配,有效应用于各种具有挑战性的场景,及传统知识迁移方法不适用的场景,如跨架构知识迁移、跨模态知识迁移和跨任务知识迁移。
- 面向未知端侧分布的压缩-适应联合AuG-KD:针对端云分布异质和源域数据和应用场景存在分布偏移的问题,通过锚点混合up-sampling生成反事实样本,实现端侧模型去偏训练,云侧模型精度最高可提升7.75%,收敛速度提升2倍。
- 基于端云协同的高效端模型参数定制DIET:通过高效模型表示构建和高效适配子网搜索,降低模型传输开销至原始大小的3%,端侧模型能力提升的同时推理速度提升5倍。
- 端云大-小模型协同推断算法:通过端设备部署小模型实时检测端环境变化,预估请求大模型响应价值,动态规划对云侧大模型的请求,最大化资源有限时的线上收益,显著提升推荐性能。
人机交互应用
- 人机交互“智”:理解使用者,如短视频APP、购物APP通过行为数据预测用户兴趣,但AI难以适应情感和临时兴趣变化。
- 人机交互“能”:像人一样行动,如语音助手和端智能体,但现有基于MLLM的图形用户界面(GUI)智能体在复杂任务中缺乏多步推理能力,且易受环境注入攻击的影响。
- 研究方向包括面向智能交互的端侧多模态大模型InfiGUIAgent,通过Native Reasoning和Reflection提升智能体多步推理能力;以及OS Agent感知层面的环境注入攻击研究AEIA-MN,通过提示注入和对抗样本研究OS Agent在感知层面所面临的环境注入攻击。
总结
大小模型端云协同通过发挥云侧大模型的认知推理、多模态理解和通用泛化优势与端侧小模型的轻量部署、快速响应、个性适配优势,有效解决了移动端智能推荐、端智能体等场景中的实时性、个性化、负载成本、隐私安全等问题,为人机交互领域带来了新的发展机遇。