登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
大模型系列报告(一):Transformer架构的过去、现在和未来
信息技术
2025-01-19
-
财通证券
赵小强
核心观点
Transformer架构的过去
:受人类大脑的启示,Transformer架构通过注意力机制高效处理序列数据,显著提升了并行处理速度和长距离依赖建模能力,并在规模扩展和多模态应用方面展现出巨大潜力。
Transformer架构的局限性
:计算复杂度高和计算成本高,限制了其在长序列任务中的应用。
Transformer架构的未来
:未来发展方向主要包括两条路径,一是探索全新的架构,如RetNet、Mamba、RWKV、Hyena和线性注意力机制等,二是通过优化注意力机制等方式对现有架构进行升级,以实现更高的性能、更强的泛化能力和更低的资源消耗。
关键数据和研究结论
Transformer在处理长序列文本方面表现出色,但计算复杂度随着序列长度呈平方级增长。
RetNet架构结合了RNN和Transformer的优点,能够节省内存并提升推理速度,但长距离依赖建模能力仍需进一步验证。
Mamba架构采用循环框架和状态空间模型,实现了线性增长的计算开销,提升了长序列处理效率,但存在记忆丢失和泛化能力弱等问题。
RWKV架构融合了RNN和Transformer的优势,支持无限长序列处理,具有恒定的内存占用和计算速度,但对外部提示词格式敏感。
Hyena架构通过高效的卷积操作,显著降低了计算复杂度,但灵活性较差,应用场景有限。
线性注意力机制通过线性化Softmax操作,降低了时间复杂度,提升了模型效率,但长距离依赖建模能力较差。
Agent Attention、TransNormer LLM和MiniMax-01等模型在融合线性注意力和Softmax注意力机制方面取得了一定进展。
未来AI大模型的发展方向包括探索全新的基础理论和模型架构,以及在现有框架内深挖潜力,例如参数高效化、开发更智能的推理方法和降低对数据和算力的依赖等。
投资建议
短期来看,Transformer架构依然是大模型的主流,建议关注基础设施领域的公共事业公司,如英伟达、海思信息、寒武纪、瀚博数据、中科曙光、浪潮信息、润泽科技、欧菲光、紫光数创等,同时持续关注全球各大模型厂商和学界的创新进展。
风险提示
技术迭代不及预期
商业化落地不及预期
政策支持不及预期
全球宏观经济风险
你可能感兴趣
中国特色估值系列(一):国央企估值的过去、现在和未来
国盛证券
2023-03-08
个人养老金系列报告(一):个人养老金的过去、现在与未来
金融
华宝证券
2024-12-16
人形机器人报告(一):大模型视角下人形机器人的现在和未来
信息技术
五矿证券
2023-12-19
2025大模型Transformer架构发展历程、优势及未来发展趋势分析报告
信息技术
未知机构
2025-01-25
深度报告:重为轻根:米氏互联网的过去、现在和未来
国信证券
2018-06-26
【九点特供】到底何为新质生产力;高通首次解读AI技术白皮书!该类大算力AI芯片将与GPU产生替代竞争,这家公司自研的相关芯片已经满足基于Transformer架构的大模型需求
未知机构
2024-03-07
非Transformer架构的端侧大模型创新研究与应用
信息技术
全球人工智能开发与应用大会
2024-10-28
货币政策系列之六:中、美、欧利率联动性:过去、现在和未来
太平洋证券
2019-11-06
科技创新债券系列研究之一:科创债的过去、现在与未来
信息技术
西部证券
2025-05-29
大物流时代系列研究(七):兴替、博弈、破局:电商快递的过去、现在、未来
交通运输
华创证券
2021-10-11