登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
李正兴-腾讯游戏知几语音合成大模型推理实践
文化传媒
2024-12-06
DataFunSummit2024:生成式AI技术峰会
赵小强
推理加速方案
背景介绍
产品展示:
和平第五人的『AI语音助手』
王者荣耀小妲己“游戏知识问答”
天涯明月刀『绝智阿暖』智能NPC
技术特点:TTS更自然、韵律丰富、实时性强,采用自研知音语音大模型,10秒音频完成声音复刻,加速优化实时率达0.085。
模型结构选型与分析
语音合成大模型结构:
传统方案
基于语言模型的新方案
面临的挑战:
高并发场景
实时率问题
模型推理加速方案
推理加速方案借鉴:
借鉴NLP领域LLM推理加速方法,如kvcache、flash decode、prefix kvcache、flash attention、投机采样、Int4/int8量化、page attention等
具体方案:
kvcache
:
LLM中kvcache原理:通过缓存已计算的key和value,避免重复计算,适用于attention mask满足特定条件的场景
效果:显著减少计算量,提升效率
GQA(Generalized Query Attention)
:
适用于prefill阶段(计算受限)和decode阶段(访存受限)
相比int8/fp8量化,GQA压缩率更可控,可在保证效果的前提下减少headnum
BPE(Byte Pair Encoding)
:
借鉴NLP中的BPE分词算法,将audiotoken映射到唯一unicode,一次decode出一个BPE code对应多个audiotoken
效果:将10秒音频的token数从500个减少到约170个
批处理
:
方案一:训练使用,text和audio特征处理简单,但推理时padding attention mask复杂
方案二:推理使用,无缝使用LLM推理框架,但text和audio特征处理复杂
连续性批处理
:
结合腾讯Trpc微服务框架实践,优化批处理效率
推理加速方案-效果
实时率优化:无压力实时率从2.09优化到0.11,吞吐达1秒2500token
未来规划
将投机采样应用到语音合成大模型
将NAR模型改造成流式输出结构
尝试更多非transformer的网络架构
你可能感兴趣
大模型推理优化关键技术及应用实践研究报告(2026年)
信息技术
信通院
2026-04-15
长文本大模型推理实践——以KVCache为中心的分离式推理架构
全球人工智能开发与应用大会
2024-10-28
汽车之家-李航宇-破除知见障——大模型时代AI算法人才成长的思考
交运设备
2023第十二届全球TOP100软件案例研究峰会
2024-08-21
硅基流动高性能低成本的大模型推理云实践
信息技术
硅基流动
2024-08-01
2025年大模型推理优化与部署实践产业洞察研究报告
信息技术
云计算开源产业联盟&云原生产业联盟
2025-12-10
李庆泉-质量大模型及其在接口测试场景下的实践
电子设备
2024AI研发数字峰会AiDD北京站
2024-11-17
科大讯飞-李珍松-星火认知大模型一年四次大发布背后的平台及应用工程实践
信息技术
2023第十二届全球TOP100软件案例研究峰会
2024-08-21
Moka李国兴谈SaaS大模型20230704
未知机构
2023-07-04
Moka李国兴谈SaaS-大模型
未知机构
2023-07-04