研报总结
一、引言
本研报介绍了浙江大学DeepSeek系列专题线上公开课第四期的内容,主要围绕DeepSeek大模型的技术特点、与ChatGPT的对比、面临的争议以及未来发展路径展开讨论。
二、DeepSeek大模型的技术特点
- 多语言支持:DeepSeek涵盖多语言、数学、编程等领域,其中87%为代码,10%为英文,3%为中文,且中文语料经过精校,包括古典文献、网络文学、社交媒体、学术论文等。
- 数据处理技术:DeepSeek采用多层净化技术,数据噪音剔除精度达99.7%;结合古典语法与现代汉语的分词算法,使成语理解准确率提升38%;通过两阶段扩展训练,将上下文窗口扩展至128K,增强长文本处理能力。
- 模型性能:在汉字进行模型训练方面,DeepSeek的性能优于ChatGPT。
三、DeepSeek面临的争议
- 知识蒸馏的原创性:研报认为知识蒸馏并非抄袭,而是基于现有技术的创新应用。
- 人工智能是资源黑洞还是效率革命:研报指出,人工智能可以通过技术革新和算力优化,提高效率并降低资源消耗。
四、DeepSeek的成功之道
- 中华文化基因:DeepSeek的成功得益于对中华文化基因的传承和创新,例如汉字的演变和阴阳五行思想的应用。
- 技术突破:DeepSeek通过算力优化、架构创新和算法革新,实现了技术突围。
五、AI的道与术
- 道与术的定义:道是指规律、道理和本源,术则是指具体的方法和技巧。
- AI的道与术:AI的道是指智能,包括心智和行动;术是指算法和技术。
- AI的伦理安全:AI发展需要关注伦理安全,例如算法偏见、统治和道德困境等问题。
六、增强本地DeepSeek能力的方案
- 微调检索:通过微调模型,提高模型在特定任务或领域的性能。
- 增强生成:利用外部知识库增强答案的时效性和准确性。
- 提示词工程:通过精心设计输入提示,引导LLM生成期望的高质量输出。
七、本地部署RAG
- RAG的原理:RAG(Retrieval-Augmented Generation)通过检索增强生成,提高答案的准确性和可信度。
- RAG的部署过程:包括下载安装CherryStudio、下载基座模型和嵌入模型、配置OLLAMA接口、管理Ollama模型和管理知识库文件等步骤。
八、大模型微调技术
- LoRA:LoRA通过训练低秩矩阵,实现模型的微调,减少训练资源需求。
- Backbone:Backbone通过在基础模型输出端装载骨架模型,进行微调,实现不同专业场景的任务。
九、轻代码微调方法
- LLaMA-Factory:LLaMA-Factory提供轻代码微调工具,简化模型微调过程。
- 训练模板制作:通过修改训练模板,进行模型微调。
十、DeepSeek本地微调的简单应用
- AI智能助教:DeepSeek可以用于构建AI智能助教,提供答疑和辅助教学功能。
- 虚拟仿真实验室:DeepSeek可以与虚拟仿真实验室集成,提供更丰富的教学体验。
十一、展望
- 走一条属于中国的AI之路:DeepSeek代表了AI发展的新方向,未来有望在更多领域取得突破。
- 揭开神秘面纱:AI技术有望揭开推背图、梅花易数等神秘文化的面纱。
十二、核心观点
- DeepSeek大模型在多语言支持、数据处理技术和模型性能方面具有显著优势。
- DeepSeek的成功得益于对中华文化基因的传承和创新,以及技术突破。
- AI发展需要关注伦理安全,并走一条属于中国的AI之路。