登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
2024年大语言模型的能力边界与发展思考报告
文化传媒
2024-11-14
-
复旦大学
任云鹏
大语言模型的能力边界与发展思考
能力展示
:
ChatGPT在2023年展示了强大的能力,包括报税、写诗、写代码等,几乎无所不能。
2024年,尽管大模型能力有所提升,但在某些特定任务上仍然存在问题,如在数学题目的“陷阱”上表现不佳。
知识获取与压缩
:
大模型通过海量数据预训练,能够压缩和表示知识。
预训练阶段需要大量数据曝光才能有效记忆知识,通常需要达到2bit/参数。
质量高的训练数据对模型知识记忆至关重要。
微调与强化学习
:
微调数据量对模型性能有显著影响,60个样本即可有效提升模型的QA能力。
混合任务数据在低资源场景下有助于提升性能,但在高资源场景下可能表现较差。
LoRA+MoE架构有助于维持模型的世界知识。
核心挑战
:
大规模微调可能会破坏模型原有的世界知识,尤其是在某些特定任务上表现不佳。
知识回答与其他任务之间存在冲突,需要通过LoRA+MoE等方法来解决。
总结
:
大语言模型的能力依赖于基础理论和大量的数据训练。
通过精细设计的微调数据和策略,可以有效提升模型在特定任务上的表现。
在保持原有知识的同时,进一步提升模型的特定任务能力是未来发展的关键。
你可能感兴趣
大语言模型能力来源与边界
复旦大学
2025-04-24
2024年中国大语言模型能力评析(一):评测方法论与综合评测结果-AI变革行业创新发展
信息技术
头豹研究院
2024-06-27
2024年基于大语言模型的新型电力系统运行与仿真初探报告
信息技术
香港中文大学(深圳)
2024-12-23
AI+HR 趋势观察报告:从工具提效到组织重构:AI 时代 HR 的新角色、新边界与新能力
信息技术
深蓝君管理咨询(上海)有限公司
2026-06-15
2024年投资者开放日交流与思考:新能源车险转型升级的烦恼,需用发展的思维来解决
东吴证券
2024-11-11
2024年大语言模型理论与实践报告
信息技术
复旦大学
2024-11-14
使用大语言模型进行自动题目生成:TIMSS四年级的发展与验证
波兰科学院哲学与社会学研究所
2025-10-20
2024年中国大语言模型能力评析(三):行业应用能力评测结果
信息技术
头豹研究院
2024-11-06
2024年人工智能快速发展背景下算力电力协同发展的思考报告
信息技术
国家电网
2025-01-13
人工智能行业专题(11):探究模型能力与应用的进展和边界
信息技术
国信证券
2025-08-25