大模型时代的智能硬件产品趋势
腾讯云定义了多模态大模型时代下智能硬件的“看、听、说”I/O标准化,主要趋势包括:
- 功能扩展:支持“看、听、说”多种交互方式,如看环境、听写、口语陪练、情感陪伴等。
- 多语支持:覆盖东南亚、日韩、德法意葡西等多种语言,支持本地语言。
- 低延时与智能化:低延时智能打断、方言支持、网络搜索、位置搜索、音频/视频/文档/图片/音乐/视频生成。
- 感知与交互:近场通信、语音交互、定向拾音、看听增强、拍照录像直播、第一视角感知、人/位置/环境感知、情绪交换、名片碰一碰加好友、支付通行。
腾讯云平台对智能硬件开发者的开放能力
腾讯云为智能硬件开发者提供开放能力,包括:
- 微信会议场景:语音交互、视频直播、近场通信、社交关系、会议摘要、声纹区分、多语言支持、微信通话、拍照分享、视频号直播、语音AIAgent、低延时全球接入、画质超分、实时字幕、多语翻译、电商直播互动、运动直播互动。
- 智能设备与微信原生音视频通话:设备一键呼叫,微信持续响铃提醒,触达率和流畅通话体验高,支持RTOS/Linux,低功耗,资源占用低,全线适配视频、音频芯片。
- TWeTalk多模态对话:包含“跟我说、听我说、让我看、微信通话”等功能,支持唤醒/降噪/回声消除、远场增益、Linux/RTOS双向音视频、ASR语义打断、LLM、TTS,可接第三方LLM和TTSSWeSee(多模态)、TWeCall(微通话)、TWeTalk(AI对话)、P2P音视频RTC服务。
- 应用场景:教育(听写、背诵、口语陪练)、陪伴机器人(情感陪伴、康养咨询)、全屋智能(Function Call)、AI Agent(陪伴、教育、出行、客服、酒店服务)。
智能耳机、智能眼镜会议场景
腾讯云提供智能耳机、智能眼镜的会议场景解决方案,特点包括:
- 音频降噪:背景音降噪、回声抑制、弱网时自动切换,使用Penguins语音引擎提升音质。
- 多说话人分离:支持多说话人分离功能,声纹讲转写内容按发言人拆分,支持修改发言人名称,会议录制文件支持按发言人回顾。
- 实时转写+字幕:自动识别声源语言并转写为字幕,支持翻译成中文、英语、日语等,增强目标讲话人语音,适用于开放工位和户外场景。
- 多语言支持:会议内容实时转为文字,支持翻译为日语、韩语、俄语等17种语言,会中可随时回顾,支持导出为文本形式。
腾讯云方言大模型
腾讯云方言大模型支持多种方言,如上海话、四川话等,提供自定义热词、行业领域词汇、转写支持多语言等功能。
AR
AR功能未在正文中详细展开。