欢迎光临
我们一直在努力

机器学习基础一:监督学习、无监督学习与强化学习范式

 机器学习基础一:监督学习、无监督学习与强化学习范式

12.1 本章导学

在完成 Python 工具栈的学习后,我们正式进入机器学习核心理论模块。机器学习是人工智能的主流实现路径,也是深度学习、大模型的基础。所有的大模型技术,本质上都是机器学习方法在海量数据和大规模算力支撑下的高阶演化。理解机器学习的核心范式,才能真正理解大模型的技术定位和底层逻辑,而不是只会调用 API。

很多初学者容易陷入两个极端:要么觉得机器学习就是调库调参,不需要懂原理;要么觉得数学太难,直接放弃。本章从最基础的范式分类入手,不讲复杂的公式推导,先建立整体的知识框架,讲清楚三大核心范式的定义、原理、适用场景、典型算法,以及它们和大模型的关联。

本章是机器学习模块的开篇,核心目标是搭建机器学习的整体认知框架,理解三大范式的区别与联系,了解机器学习的通用工作流程,为后续具体算法和深度学习的学习打下基础。

12.2 机器学习的核心定义与通用流程

12.2.1 什么是机器学习

机器学习是人工智能的一个子领域,它研究如何让计算机从数据中自动学习规律,无需人工编写明确的规则,就能完成预测和决策任务。 传统编程是人类编写好所有规则,计算机按照规则执行,输入数据得到结果。它适合规则明确的场景,但面对图像识别、自然语言理解这类规则无法穷举的场景就束手无策。 机器学习的逻辑正好相反:给计算机大量数据和对应的结果,让计算机自己从中学到输入到输出的映射规则。学到的规则可以用来预测新的未知数据。 简单来说,传统编程是数据加规则得到结果,机器学习是数据加结果得到规则。

机器学习的核心价值在于,它能够处理复杂的、非结构化的、规则无法枚举的问题,这也是它能够支撑起人工智能革命的根本原因。

12.2.2 机器学习的通用工作流程

一个完整的机器学习项目,从问题定义到上线落地,遵循标准化的工作流程。理解这个流程,就能建立对机器学习项目的全局认知。 第一步,问题定义与业务理解。明确要解决的业务问题是什么,判断能不能用机器学习解决,属于什么类型的任务,确定评估指标。这一步是方向,方向错了后续所有工作都会偏离。 第二步,数据收集与预处理。收集相关业务数据,清洗脏数据,处理缺失值、异常值、重复值,保证数据质量。这一步是基础,数据质量决定了模型效果的上限。 第三步,特征工程。对原始数据进行加工,提取出对预测任务有用的特征,包括特征构造、特征筛选、特征编码、归一化等。特征工程直接影响模型效果,是传统机器学习项目中最考验经验的环节。 第四步,模型选择与训练。根据任务类型和数据特点,选择合适的算法,在训练集上训练模型,调整模型参数。 第五步,模型评估与调优。在测试集上评估模型效果,通过特征优化、参数调优、算法迭代提升模型性能,直到达到业务要求。 第六步,模型部署与监控。将训练好的模型部署到生产环境,提供在线服务;持续监控线上效果,定期迭代更新模型,应对数据分布的变化。

在整个流程中,数据处理和特征工程占据了大部分工作量,模型训练反而只是其中的一小部分。算法不是越复杂越好,能够解决业务问题、性价比最高的方案就是最好的方案。

12.3 监督学习:从标注数据中学习映射

监督学习是机器学习中最成熟、应用最广泛的范式,也是工业界落地最多的类型。

12.3.1 核心定义

监督学习的训练数据带有明确的标签,也就是正确答案。模型在有监督的环境下学习,学习从输入特征到输出标签的映射关系。学习的目标是,对于新的未知输入,能够准确预测对应的标签。 就像学生做题,有标准答案可以对照,做错了就调整思路,直到正确率越来越高。监督学习的 “监督”,就来自于数据中的标签。

监督学习有两个核心前提:一是要有标注好的训练数据;二是输入和输出之间存在可学习的映射关系。这两个条件满足时,监督学习就能取得很好的效果。

12.3.2 两大核心任务

监督学习分为分类和回归两大类任务,覆盖了绝大多数工业场景。 分类任务的输出是离散的类别标签,也就是预测样本属于哪一类。根据类别数量又分为二分类和多分类。二分类只有两个类别,比如判断邮件是不是垃圾邮件、用户会不会流失、肿瘤是良性还是恶性。多分类有三个及以上类别,比如图像识别区分十种物体、文本分类划分二十个新闻类别。 回归任务的输出是连续的数值,也就是预测一个具体的数值。比如预测房价、预测销售额、预测用户的消费金额、预测设备的剩余使用寿命。 分类和回归不是完全割裂的,很多算法稍作调整就能同时支持两类任务。二者最核心的区别是输出类型不同,对应的损失函数和评估指标也不同。

12.3.3 典型算法与应用场景

监督学习的经典算法非常丰富,不同算法有不同的适用场景。 线性回归和逻辑回归是最简单的基础算法,分别对应回归和二分类任务。它们原理简单、可解释性强,通常作为基线模型,也适合数据量小、特征少的场景。 决策树、随机森林、梯度提升树是树类算法,是传统机器学习的主力军。它们对数据要求低、效果稳定、可解释性较好,广泛应用于金融风控、推荐系统、业务预测等场景,是工业界最常用的传统算法。 支持向量机、朴素贝叶斯是经典的分类算法,在特定场景下有不错的表现。 深度学习、大模型也属于监督学习的范畴,当数据量和算力足够时,深度学习的效果远超传统算法。尤其是在图像、语音、文本这类非结构化数据上,深度学习有压倒性的优势。

监督学习的应用场景极其广泛:人脸识别、语音识别、文本分类、垃圾邮件过滤、房价预测、风控评分、医疗诊断,几乎所有我们熟悉的 AI 应用,背后都有监督学习的影子。

12.3.4 优势与局限

监督学习的优势是:目标明确,效果可量化;训练收敛稳定,落地成熟;有大量成熟的算法和工具支撑。 它的局限也很明显:高度依赖标注数据,标注成本高;只能完成预设的单一任务,泛化能力有限;任务迁移需要重新标注数据、重新训练模型。 大模型的预训练 + 微调范式,很大程度上缓解了这些问题,但微调阶段本质上依然是监督学习。

12.4 无监督学习:挖掘无标注数据的内在结构

无监督学习的训练数据没有任何标签,只有输入数据本身。模型需要自己去发现数据中隐藏的结构、模式和规律,没有标准答案作为参考。

12.4.1 核心定义

无监督学习的目标,是从无标注数据中挖掘数据的内在结构和分布规律。它不需要人工标注,极大降低了数据成本,能够利用海量的无标注数据。 就像给学生一堆不同类型的物品,不告诉分类标准,让学生自己根据相似性把物品分组。没有绝对的对错,只有结构发现的合理程度。

无监督学习的价值在于,现实世界中绝大多数数据都是没有标注的,标注数据成本高、数量少,而无标注数据几乎取之不尽。如果能从无标注数据中学习到有用的信息,就能极大拓展机器学习的应用边界。

12.4.2 两大核心任务

无监督学习最核心的两类任务是聚类和降维。 聚类任务是把相似的数据自动分成不同的组,同一组内的数据相似度高,不同组之间相似度低。和分类不同,聚类事先不知道类别是什么,也不知道有多少个类别,完全由算法根据数据特征自动划分。 典型的聚类算法包括 K-Means、层次聚类、DBSCAN 等。聚类的应用场景非常多:用户分群、商品分类、异常检测、文本主题挖掘、图像分割。在大模型数据处理中,聚类也常用于数据去重、难例挖掘。 降维任务是在保留核心信息的前提下,减少数据的特征维度。高维数据存在维度灾难,计算量大、可视化困难、容易过拟合。降维能够压缩数据量、去除冗余噪声、让数据可视化成为可能。 经典的降维算法包括主成分分析 PCA、t-SNE、自编码器等。降维常用于数据可视化、特征压缩、预处理去噪。在深度学习中,特征提取的过程本质上也是一种降维,把高维的原始数据转换为低维的有效表征。

12.4.3 自监督学习:无监督的重要分支

自监督学习是无监督学习的一个重要分支,也是大模型预训练的核心技术范式。 自监督学习的核心思路是:从数据本身构造监督信号,自己给自己做标签,不需要人工标注。比如在自然语言处理中,遮住句子里的某个词,让模型预测被遮住的词;在计算机视觉中,打乱图片的块,让模型预测正确的顺序。监督信号完全来自数据本身,不需要人工标注。 自监督学习解决了无监督学习目标不明确的问题,又保留了无需人工标注的优势,能够利用海量的无标注数据学习通用的表征能力。 大模型的预训练阶段,本质就是自监督学习。通过在万亿级别的无标注文本上进行自监督训练,模型学习到通用的语言规律和世界知识,具备了强大的通用能力。这是大模型能够成功的核心技术原因之一。

12.4.4 优势与局限

无监督学习的优势是:不需要标注数据,数据成本低,能够利用海量无标注数据;能够发现数据中未知的模式,适合探索性分析。 它的局限是:效果评估比较困难,没有统一的对错标准;算法稳定性相对弱一些;结果的可解释性较差。 自监督学习的出现,极大提升了无监督学习的价值,也让无监督学习从辅助角色变成了大模型的核心训练范式。

12.5 强化学习:从环境交互中学习最优策略

强化学习和前两种范式完全不同,它不是从静态数据中学习,而是通过智能体与环境的动态交互,根据奖励反馈来优化行为策略。

12.5.1 核心定义

强化学习的核心机制是:智能体在环境中感知状态,做出动作,环境根据动作给出奖励反馈,并进入新的状态。智能体的目标是最大化长期累积奖励,通过不断试错,学会在不同状态下选择最优的动作。 就像训练小狗,做对了给零食奖励,做错了不给奖励,时间长了小狗就会学会正确的行为。强化学习的 “强化”,就来自于奖励对行为的正向或负向强化。

强化学习有五大核心要素:智能体、环境、状态、动作、奖励。其中奖励是引导学习方向的核心信号,奖励函数的设计直接决定了强化学习的效果。

12.5.2 典型算法与应用场景

强化学习算法分为基于价值、基于策略、基于演员评论家三大类。经典算法包括 Q-Learning、SARSA、策略梯度、DQN、PPO 等。其中 PPO 算法因为稳定性好、效果优秀,是当前大模型对齐阶段的主流算法。 强化学习适合解决序列决策类问题,也就是需要连续做一系列决策才能得到最终结果的任务。 典型应用场景包括:游戏 AI,比如 AlphaGo、星际争霸 AI;机器人控制,让机器人学会行走和操作;自动驾驶的决策规划模块;推荐系统的排序优化;资源调度优化。 近年来,强化学习和大模型结合,产生了 RLHF 技术,用于大模型的对齐阶段,让模型输出更符合人类偏好。这也是强化学习目前最受关注的应用之一。

12.5.3 优势与局限

强化学习的优势是:能够在动态环境中学习最优策略,适合复杂决策场景;不需要标注数据,只需要设计奖励函数。 它的局限也非常明显:训练成本高,需要大量的环境交互,样本效率低;奖励函数设计难度大,容易出现奖励劫持问题;训练不稳定,调参难度大。 目前强化学习的落地场景远少于监督学习,但它是实现通用智能的重要路径之一,和大模型的结合正在不断拓展它的应用边界。

12.6 三大范式对比与衍生范式

12.6.1 三大范式核心对比

三大范式最核心的区别在于训练数据的形式和学习目标不同。 监督学习有标签,目标是学习输入到输出的映射,适合预测分类任务; 无监督学习无标签,目标是发现数据内在结构,适合聚类降维探索; 强化学习有奖励反馈,目标是最大化长期收益,适合序列决策任务。

从数据成本来看,监督学习标注成本最高,无监督学习数据成本最低,强化学习介于二者之间但交互成本高。 从落地成熟度来看,监督学习最成熟,工业应用最多;无监督学习次之,多用于辅助分析;强化学习落地场景相对较少,技术门槛更高。

12.6.2 重要衍生范式

除了三大基础范式,还有几类衍生范式在实际应用中非常重要,也和大模型技术密切相关。 半监督学习:训练数据中只有一小部分有标签,大部分没有标签。结合监督学习和无监督学习的优势,用少量标注数据引导方向,大量无标注数据提升模型效果。非常适合标注成本高、无标注数据多的场景。 迁移学习:把从一个任务上学到的知识,迁移应用到另一个相关任务上,减少新任务的数据需求,提升学习效率。大模型的预训练 + 微调模式,本质就是迁移学习的极致体现。通用大模型在海量数据上预训练学到通用能力,迁移到下游任务只需要少量数据微调。 多任务学习:同一个模型同时学习多个相关任务,共享特征表示,互相促进提升效果。大模型的通用能力,本质上就是海量任务共同训练的结果。

这些衍生范式不是独立于三大范式之外的全新体系,而是基础范式的组合与延伸,也是大模型时代非常重要的技术思想。

12.7 机器学习与大模型的关联

很多学习者会疑惑:学大模型为什么还要学传统机器学习?答案是,大模型不是凭空出现的全新事物,它是机器学习技术发展到高阶阶段的产物,所有核心思想都源自机器学习的经典理论。 第一,大模型预训练是自监督学习,属于无监督学习的分支。海量无标注数据的自监督训练,让模型获得通用能力,这是无监督学习价值的最大化体现。 第二,大模型微调是监督学习。用下游任务的标注数据微调模型,适配具体任务,本质就是监督学习的迁移应用。 第三,大模型对齐用到强化学习。RLHF 通过人类反馈训练奖励模型,再用强化学习优化大模型,是强化学习在生成式场景的创新应用。 第四,机器学习的基础理论,比如泛化、过拟合、偏差方差权衡、损失函数、评估指标,全部适用于大模型。理解了这些基础理论,才能真正理解大模型的各种现象,而不是只会机械地调用接口。

简单来说,大模型放大了机器学习的能力,但底层的逻辑和规律是共通的。打好机器学习基础,才能在大模型这条路上走得更深更远。

12.8 本章小结

本章搭建了机器学习的整体认知框架,系统讲解了三大核心范式和衍生范式。核心知识点回顾:

  • 机器学习让机器从数据中学习规律,包含数据处理、特征工程、模型训练、评估部署的完整流程;
  • 监督学习基于标注数据学习映射,分为分类和回归任务,是工业界最成熟的范式;
  • 无监督学习挖掘无标注数据的内在结构,聚类和降维是核心任务,自监督学习是大模型预训练的核心;
  • 强化学习通过环境交互和奖励反馈优化策略,适合序列决策场景,是大模型对齐的重要技术;
  • 半监督、迁移学习等衍生范式拓展了机器学习的能力边界,也是大模型的重要技术思想;
  • 大模型是机器学习的高阶演化,底层理论完全共通,打好机器学习基础至关重要。
  • 课后思考任务:

  • 列举三个生活中的 AI 应用,分别判断它们属于哪一种机器学习范式;
  • 思考为什么大模型的预训练阶段使用自监督学习,而不是直接用监督学习;
  • 结合自己的工作或学习场景,思考哪些问题可以用机器学习解决,分别适合什么范式。
  • 赞(0)
    未经允许不得转载:171主机测评 » 机器学习基础一:监督学习、无监督学习与强化学习范式
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址