-
DeepSeek企业背景:DeepSeek成立于2023年7月,是一家专注于大语言模型(LLM)和相关技术开发的创新型科技公司。公司背靠幻方量化,由幻方量化创始人梁文锋创立。
-
DeepSeek模型家族:DeepSeek拥有多个模型,包括DeepSeekLLM、DeepSeek-v2、DeepSeek-v3和DeepSeek-R1。
-
DeepSeek技术创新:
- DeepSeek-v2采用MoE架构,参数量为236B,节省了42.5%的训练成本,提高了5.76倍的吞吐量。
- DeepSeek-v3参数量为671B,推理速度大幅提升,训练成本大幅降低,仅需278.8万GPU小时。
- DeepSeek-R1参数量为621B,性能与OpenAI GPT-4相当,采用纯强化学习训练,并融入冷启动数据和多阶段训练策略。
-
DeepSeek商业模式:未详细说明。
-
DeepSeek应用场景:未详细说明。
-
AI大模型市场现状:未详细说明。
-
DeepSeek对AI行业影响:DeepSeek的技术创新在降低训练成本、提高推理速度和模型性能方面具有显著优势,对AI行业具有积极影响。