登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
会议纪要
/
报告详情
GPU 编程和优化 – 最佳实践分享
2023-10-24
NVIDIA
浮云
主题演讲
GPU 编程和优化–最佳实践分享
: 刘冰/郑鹏分享了 CUDA 编程优化的基础知识,包括全局内存对齐、共享内存银行冲突、ILP 和 TLP 等概念,并通过案例分析讲解如何融合 MHA 和 FMHA 来提升性能。
在 NVIDIA NeMo 中实现大语言模型全周期开发 –以 LLaMa2 为例
: 姚鑫/颜子杰介绍了 NeMo 框架的功能和结构,并详细讲解了使用 NeMo 框架进行 LLaMa2 模型的全周期开发流程,包括预训练、微调(SFT 和 PEFT)、RLHF 和 TRT-LLM 等阶段。
TensorRT Hackathon 2023 总结
: 季光/陈庾回顾了 TensorRT Hackathon 的活动内容,包括初赛和复赛的赛制、赛况和成果,并总结了赛事的特点和经验。
Accelerating LLaMA Inference with Quantization in TensorRT-LLM
: 陈庾介绍了如何在 TensorRT-LLM 中构建和运行 LLaMA 模型,以及如何对 LLaMA 模型进行量化,包括权重量化、INT8 KV 缓存和 INT8 SmoothQuant 等方法,并展示了量化后的模型在准确性和性能方面的表现。
向量数据库的加速策略和实战
: 王雍/张静蓉讲解了向量数据库的加速策略,包括近似最近邻搜索(ANN)算法、GPU 加速索引技术和向量数据库的实战案例,并介绍了 RAPIDS RAFT 和 CAGRA 等工具。
推荐系统的最新优化策略和实践–以 HPS 为例
: 魏英灿/王泽寰介绍了 HPS(Hierarchical Parameter Server)的架构和功能,并详细讲解了 HPS 的 GPU 嵌入式推理缓存(EIC)的实现方式,包括设备锁、主机锁和无锁实现等方案,最后展示了 HPS 在不同 NVIDIA GPU 上的性能评估结果。
分组讨论及答疑
GPU 专家
: 刘冰/郑鹏/郁凡/王猛
大语言模型训练
: 颜子杰/陶砺/姚鑫
TRT LLM 以及扩散模型
: 季光/薛博阳/陈庾/方杰
向量数据库
: 王雍/张静蓉/董建兵
推荐系统的训练与推理
: 魏英灿/王泽寰/张耀斌/孙凯
你可能感兴趣
云原生时代下大规模 GPU 资源利用率优化最佳实践
信息技术
快手
2023-10-08
分享关于电池储能系统(BESS)标准在促进安全、能源韧性和可持续性方面作用的最佳实践和能力建设。
电气设备
亚太组织
2024-05-15
APPC最佳城市达峰减排实践比较和分享
中国达峰先锋城市联盟
2016-07-07
最佳城市达峰减排实践比较和分享
公用事业
RMI
2018-03-24
余英豪 - 阿里巴巴万卡 GPU PAI 集群的资源效率优化:数据剖析和工程实践
建筑建材
DataFunSummit2022:大数据计算架构峰会
2022-05-19
云成本和基础设施优化组织的3个最佳实践
信息技术
flexera
2023-12-01
推荐系统 :构建、部署和优化的最佳实践
NVIDIA
2022-12-06
国产 GPU 技术选型与金融场景实践分享
腾讯
2026-03-31
GOPS2024-业技融合新范式·数字原生新方向:BizDevops行业最佳实践及标准解读分享-脱敏版
信息技术
2024 第22届 GOPS 全球运维大会暨 XOps 技术创新峰会 · 深圳站
2024-05-13
DeepSeek消费电子行业大模型新型应用最佳实践分享
腾讯
2025-03-26