人工智能基础知识
核心概念
人工智能(AI)是指使计算机和机器能够模拟人类学习、理解、解决问题、决策、创造和自主性的技术。AI 使用复杂的算法来处理、学习和制定解决方案,利用数据模拟人类大脑的输入、处理和决策过程。AI 工具的开发需要先 curated 大型数据集,然后设计适合特定用例的 AI 算法或模型(称为训练),最后将数据输入模型以获取洞察和结论(称为推理)。
AI 发展阶段
AI 领域于 1956 年被确认为一个学术学科,但由于计算能力限制,基于 AI 的应用直到几十年后才商业化。目前,关键的 AI 技术包括机器学习(ML)、深度学习(DL)和自然语言处理(NLP)。AI 正在从生成式阶段向代理式、物理式、科学式和通用式阶段发展,这些阶段需要不断增加的基础设施支持。
生成式 AI
生成式 AI 是一种能够根据用户提示或请求创建文本、图像、视频、音频或软件的 AI 类型。它使用深度学习模型模拟人脑的学习过程,通过识别数据集中的模式和关系来创建新内容。ChatGPT 的发布使生成式 AI 广受欢迎,其应用包括内容生成、数据提取、文本摘要、优化网络浏览器、语言翻译和计算机编程等。
深度学习
深度学习是机器学习的一个子集,使用受大脑结构和功能启发的算法,即人工神经网络。神经网络由多个处理数据的“层”组成,每个层由相互连接的节点组成,每个节点都在前一层的基础上完善和优化模型预测。深度学习模型比机器学习模型具有更多层,允许模型获取更多概念,并能识别难以发现的数据关系。
神经网络的三种特征
- 架构:指定网络中涉及的变量及其关系。
- 活动规则:定义神经元如何相互响应。
- 学习规则:定义神经网络的权重随时间如何变化。
神经网络的类型
- 卷积神经网络(CNN):用于图像处理问题,如分类和对象识别。
- 循环神经网络(RNN):可以处理和预测序列数据。
- 生成对抗网络(GAN):使用两个子网络自动训练模型,一个用于区分真实和生成数据,另一个用于生成模仿实际数据的图像。
- Transformer 模型:应用数学方法来理解序列数据之间的关系,可用于实时文本/语音翻译以及理解 DNA 中遗传序列的模式/关系。
基础模型
基础模型是深度学习模型,在广泛的一般化和未标记的数据上进行训练,可以执行各种一般任务,如理解和对话自然语言、回答问题以及生成文本和图像。大型语言模型(LLM)是基础模型的一种,专注于自然语言处理。
大型语言模型
大型语言模型是生成式 AI 基础模型,能够识别、理解、预测和生成文本。它们通过在大量文本数据上进行训练来理解人类语言,并生成新的文本内容。LLM 的应用包括内容生成、数据提取、文本摘要、优化网络浏览器、语言翻译和计算机编程等。
机器学习
机器学习是一种 AI,允许程序在没有特定编程的情况下解决复杂问题。机器学习模型通过在大量数据集上进行训练来学习人类文本语言的模式,并预测下一个可能出现的单词。机器学习的关键操作是特征值选择,即输入到机器学习过程中的数据项,其准确性受选择和确定这些特征的方法的影响。
自然语言处理
自然语言处理是 AI 的一个领域,使机器能够理解人类语言,包括俚语、缩写和发音,并生成类似人类的文本。NLP 应用不同的算法来识别和提取自然语言规则,将非结构化语言数据转换为计算机可以解释的形式。NLP 是分析文本和语音数据的完整和高效的关键工具,也是生成式 AI 理解和解释人类语言以生成新内容的基础。
开源与闭源模型
- 开源模型:软件发布在许可证下,允许用户免费使用、研究、修改和分发软件及其源代码。开源模型公开且免费,开发者可以使用它们创建各种应用程序。
- 闭源模型:专有系统,其源代码不公开。开源模型允许任何人访问和修改模型,从而比闭源模型具有更高的透明度和协作性,最终实现 AI 模型的民主化。
小型语言模型
小型语言模型(SLM)是生成式 AI 模型,能够理解和生成自然语言。它们比大型语言模型更小,参数大小从几百万到几亿不等,而大型语言模型有几百亿甚至几千亿个参数。SLM 通常比 LLM 更高效,需要更少的内存和计算能力,更适合边缘环境、移动应用程序或离线 AI 推理。SLM 的性能在常识推理、问题解决和数学方面正在改进,缩小了 LLM 在一般推理任务中的差距。
SLM 通过知识蒸馏、剪枝和量化实现其较小的尺寸和效率。知识蒸馏将预训练 LLM 的知识转移到较小的模型,剪枝去除不太有用的参数,量化将高精度数据的权重转换为低精度数据,减少表示信息所需的位数。