在人工智能的学习中,打好基础的关键是理解核心基本术语,本文将围绕人工智能机器学习方向的基础术语展开详细讲解,帮助大家构建清晰的概念体系,所有术语讲解均结合「好瓜 / 坏瓜」的经典案例,更易理解。
一、模型与模式
这两个概念是从数据中学得结果的不同表述,核心区别在于结果的范围属性:
- 模型:从数据中学得的全局性结果,例如一棵决策树、一个神经网络模型等,是对整体数据规律的综合提炼。
- 模式:从数据中学得的局部性结果,例如一条分类规则(如 “色泽青绿且根蒂蜷缩的瓜是好瓜”),是针对局部数据特征的总结。
二、数据集与样本相关
这组术语描述了人工智能学习的数据基础,是后续所有学习和训练的前提,各概念层层关联:
数据集:记录数据的集合,是数据的整体载体,例如包含多个瓜的色泽、根蒂、敲声及好坏标签的所有数据汇总。
样本(示例 /instance):关于一个事件或对象描述的每条记录,即数据集中的单条数据,例如某一个瓜的色泽、根蒂、敲声信息。
特征(属性 /attribute):反映事件或者对象在某方面的表现或者性质的事项,是样本的组成维度,例如瓜的色泽、根蒂、敲声都是特征。
属性值:属性上的具体取值,例如色泽的 “青绿”“乌黑”“浅白”,根蒂的 “蜷缩”“硬挺”“稍蜷”。
属性空间(样本空间 / 输入空间):由所有属性张成的空间,每个属性代表一个维度,样本可在该空间中找到对应位置。
特征向量:一个示例的另一种表述,将样本的各属性值按顺序组合成向量,每个示例在样本空间中对应一个坐标向量,例如(青绿,蜷缩,浊响)就是一个特征向量。
三、学习与训练相关
这组术语描述了从数据到模型的过程,是机器学习的核心环节,明确了过程中的各类要素定义:
学习(训练):从数据中学得模型的整个过程,是人工智能从数据中提取规律的核心动作。
训练数据:训练过程中所使用的全部数据,是模型学习的 “原材料”。
训练样本:训练数据中的每一个样本,是模型学习的基本单位。
训练集:由所有训练样本组成的集合,即训练数据的集合形式。
假设:学得模型所对应的关于数据的某种潜在规律,是模型对数据规律的拟合结果。
真相(ground truth):数据本身客观存在的潜在规律,是模型学习的终极目标。
学习器:实现学习过程的算法 / 工具载体,是学习行为的执行主体。核心逻辑:学习过程的本质,就是让学习器通过训练集从训练数据中学习,找出数据的真相或尽可能逼近真相。
四、标记与样例相关
这组术语围绕样本的结果信息展开,是区分有标签 / 无标签数据的关键,也是监督学习的核心要素:
标记(Label):关于示例结果的信息,是样本的 “结果标签”,例如瓜的 “好瓜”“坏瓜”、瓜的成熟度 0.95。
样例(example):拥有标记信息的示例,是 “特征 + 标记” 的组合体,例如((色泽 = 青绿;根蒂 = 蜷缩;敲声 = 浊响),好瓜)。
标记空间(输出空间):所有标记的集合,是模型预测结果的取值范围,例如 {好瓜,坏瓜}、[0,1] 的成熟度区间。
五、预测任务分类
根据模型预测结果的类型,可将机器学习的预测任务分为分类和回归两大类,这是机器学习的核心任务划分方式:
分类(classification):预测的结果为离散值的任务,核心是 “类别判断”。
- 示例:判断瓜是 “好瓜” 还是 “坏瓜”、判断邮件是 “垃圾邮件” 还是 “正常邮件”。
- 细分:二分类(仅有两个类别,如好瓜 / 坏瓜,其中一个为正类,另一个为反类)、多分类(两个以上类别,如判断水果是苹果 / 香蕉 / 橙子)。
回归(regression):预测的结果为连续值的任务,核心是 “数值预测”。
- 示例:预测瓜的成熟度(0.95、0.37)、预测房屋的价格、预测气温。
六、测试相关
这组术语描述了模型学成后的验证与使用过程,是检验模型效果的关键环节:
测试:学得模型之后,使用该模型对新数据进行预测的过程,核心目的是验证模型的预测能力。
测试样本:测试过程中被预测的样本,即模型需要给出预测结果的新样本,例如(浅白,蜷缩,浊响,?)就是一个待预测的测试样本。
未见样本(unseen instance):模型在训练过程中未接触过的样本,测试样本本质上就是未见样本。
七、模型性能与数据分布
这组术语描述了模型的核心能力和数据的基本假设,是评价模型优劣的关键,也是机器学习的基础前提:
泛化能力(generalization):学得模型适用于新样本(未见样本) 的能力,是模型的核心评价指标。
- 核心出发点:机器学习的目标不是让模型仅在训练样本上表现良好,而是能在从未接触过的新样本上做出准确预测,泛化能力越强,模型的实用性越高。
独立同分布(i.i.d.):机器学习的基本数据假设,即训练样本和测试样本都独立地从同一个数据分布中采样得到。只有满足该假设,模型的泛化能力才有实际意义。
未知 “分布”:数据客观存在的真实分布是未知的,模型学习的过程就是通过样本去拟合这个未知分布,从而实现对新样本的预测。
八、核心学习范式
根据数据是否带有标记信息,可将机器学习分为两大核心学习范式,是机器学习的重要分类方式:
监督学习(supervised learning):使用带有标记信息的样例进行训练的学习方式,分类、回归是典型的监督学习任务,例如用 “好瓜 / 坏瓜” 的样例训练模型判断瓜的好坏。
无监督学习(unsupervised learning):使用无标记信息的样本进行训练的学习方式,核心是发现数据的内在规律,例如聚类(将相似的瓜归为一类)、降维。
九、核心术语汇总
为方便大家快速查阅和记忆,将本文所有核心术语整理如下:
数据基础
数据集、样本(示例 /instance)、特征(属性 /attribute)、属性值、属性空间(样本空间 / 输入空间)、特征向量
过程与要素
学习(训练)、训练数据、训练样本、训练集、假设、真相(ground truth)、学习器、标记(Label)、样例(example)、标记空间(输出空间)
任务与测试
分类、回归、二分类、多分类、正类、反类、测试、测试样本、未见样本(unseen instance)
性能与分布
泛化能力(generalization)、独立同分布(i.i.d.)、未知 “分布”
学习范式
监督学习(supervised learning)、无监督学习(unsupervised learning)
以上就是人工智能机器学习方向绪论中的核心基本术语,掌握这些术语是后续学习各类算法、模型的基础,后续会基于这些基础概念,进一步讲解各类机器学习算法的原理和应用。