登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
DeepSeek - Coder :当大型语言模型遇到编程时 - 代码智能的兴起
信息技术
2024-01-26
鄯大雅,宋启浩,杨德建,谢振达,启东,张文涛,陈官厅,小智,Y. Wu,Y.K. Li,罗富力,熊英飞,梁文峰
DeepSeek&北京大学
张东旭
核心观点
DeepSeek-Coder系列开源代码模型
:该系列包含规模从13亿到330亿不等的开源代码模型,从2万亿个标记中从头开始训练,并在高质量的项目级代码语料库上进行预训练,采用16K窗口的填空任务来增强代码生成和填补能力。
性能表现
:广泛评估表明,DeepSeek-Coder不仅在多个基准测试中实现了开源代码模型的最佳性能,还超越了现有的闭源模型如Codex和GPT-3.5。
许可优势
:DeepSeek-Coder模型处于宽松的许可之下,允许同时进行研究和无限制的商业使用。
数据收集
数据来源
:DeepSeek-Coder的训练数据集由87%的源代码、10%的英语代码相关自然语言语料库和3%的代码无关的中文自然语言语料库组成。
数据构建过程
:包括GitHub数据抓取和过滤、依赖解析、仓库级别去重以及质量筛选。
GitHub数据抓取和过滤
:从GitHub上收集了截至2023年2月之前创建的公共仓库,并仅保留了87种编程语言,应用过滤规则减少数据量。
依赖解析
:解析文件间的依赖关系,并按照确保每个文件所依赖的上下文出现在该文件之前的顺序排列这些文件。
仓库级别重复数据删除
:在代码仓库级别进行去重,而不是在文件级别进行。
质量筛选和去污
:使用编译器、质量模型和启发式规则进一步过滤掉低质量的数据,并实施n-克gram过滤过程确保数据不会受到来自测试集的信息污染。
培训政策
训练策略
:包括Next Token预测和Fill-in-the-Middle(FIM)方法。
Next Token预测
:将各种文件连接以形成固定长度的条目,训练模型能够根据提供的上下文预测后续的标记。
Fill-in-the-Middle
:随机将文本分为三部分,然后打乱这三部分的顺序并用特殊字符连接它们,旨在在训练过程中融入一种填空预训练任务。
Tokenizer
:使用HuggingFace Tokenizer库进行字-piece编码(BPE)分词器训练,最终使用了一个词汇量大小为32,000的分词器。
模型体系结构
:基于DeepSeek-AI提出的DeepSeek大型语言模型(LLM)框架构建,采用解码器型Transformer,并集成了分组查询注意力(GQA)和FlashAttention v2。
优化
:使用AdamW作为优化器,并实施三阶段学习率调度策略。
Environments
:使用HAI-LLM框架进行实验,并利用配备NVIDIA A100和H800 GPU的集群。
Long Context
:将上下文长度扩展到16K,使模型能够处理更加复杂和广泛的编码任务。
Instruction Tuning
:使用高质量数据对DeepSeek-Coder-Base进行基于指令的微调,开发出DeepSeek-Coder-Instruct。
实验结果
代码生成
:在HumanEval、MBPP和DS-1000基准测试中,DeepSeek-Coder-Base取得了优异的性能,超越了所有现有的开源代码模型。
FIM代码完成
:在单行填充基准测试中,DeepSeek-Coder表现优于其更大的同类模型StarCoder和CodeLlama。
跨文件代码完成
:在CrossCodeEval基准测试中,DeepSeek-Coder在多种语言的跨文件完成任务中始终优于其他模型。
基于程序的数学推理
:在PAL方法应用的七个不同基准测试中,DeepSeek-Coder模型在所有基准测试中表现出色。
继续从一般LLM的预培训
DeepSeek-Coder-v1.5 7B
:基于DeepSeek-LLM-7B Base进行额外的预训练,使用了2万亿个令牌的数据,包括自然语言、代码和数学数据。
性能比较
:DeepSeek-Coder-v1.5 7B在大多数任务上相较于DeepSeek-Coder-Base模型表现出了明显的改进,特别是在数学推理和自然语言类别中。
结论
DeepSeek-Coder系列开源代码模型在性能上超越了现有的开源和闭源模型,并具有宽松的许可,允许同时进行研究和无限制的商业使用。
DeepSeek-Coder-Instruct模型在代码生成和理解方面表现出卓越能力。
DeepSeek-Coder-v1.5模型不仅维持了其前身在高级编程方面的高水平性能,还展示了增强的人类自然语言理解能力。
你可能感兴趣
大型语言模型遇到编程时的编码器 - 代码智能的兴起
信息技术
DeepSeek
2025-02-06
当大型语言模型遇上编程:代码智能的崛起
深度求索AI&北京大学
2024-01-26
基于大型语言模型的智能体的兴起与发展
信息技术
复旦大学
2023-09-14
基于大型语言模型的代理的兴起和潜力:一项调查
信息技术
复旦NLP集团
2025-01-07
基于大型语言模型的代理的兴起和潜力: 一项调查
复旦NLP集团
2023-09-01
当大型语言模型发展语言:为高效多智能体推理的符号通信
信息技术
中国科学院计算技术研究所人工智能安全国家重点实验室
2026-07-14
【电报解读】工信部要求加快智能编程研发应用!机构称AI代码工具已成为业内提效的关键手段,未来行业规模有望突破3500亿,这家公司通过会员订阅制模式有效促进了先进工业AI软件的应用落地-20260429
未知机构
2026-04-29
2026少儿编程新动向:当代码走出屏幕,国产机器人如何接棒?
无
2026-06-20
全面召回?大型语言模型的宏观经济知识评价(英)
文化传媒
美联储
2025-07-06
三小时掌握大型语言模型的公平性
信息技术
FIU
2024-11-24