欢迎光临
我们一直在努力

准大二学生从0开始学AI——机器学习Day15

type: learning_note

title: 项目周期与精确率召回率

date: 2026-08-06

course: "Andrew Ng — Course 2 高级学习算法"

phase: "C2 Day 8"

videos: "#84-#87"

 

# 2026-08-06 学习笔记

 

## 笔记区(学的时候随手记)

 

### 核心观点

 

– **完整项目流程**(#84):ML 项目不是一次性建模,是**迭代循环**——定义项目/目标 → 收集数据 → 训练模型 → 上线看反馈 → 反馈不好回到前面环节重来(可能补数据 / 改特征 / 调参 / 换算法)。"先定义好项目,然后收集数据,再训练模型,最后上线看反馈,训练数据不好就从收集数据这里改进,上线反馈有问题再重新训练。"

– **公平、偏见与伦理**(#85):偏见主要来自**训练数据本身**——历史数据里对特定人群的系统性偏见被模型学走。避免方法:**团队多元化**(不同背景的人参与,看到单一视角看不见的问题)、部署前做**审计/危害评估**、提前制定**缓解计划**(出问题了怎么办,自动驾驶做了这类预案)。

– **偏斜数据集的错误指标**(#86):数据严重不平衡时(罕见病、罕见故障),准确率没参考价值,改用**精确率 / 召回率**。理解这两个指标的钥匙是**混淆矩阵**(见关键方法)。

– **权衡精确率与召回率**(#87):阈值不是非得 0.5,偏斜数据下可调。调高阈值 → 预测阳性变少 → 精确率升、召回率降(**负相关**)。决策标准不是"占比大小",是**「哪种错代价大」**:漏报代价大 → 高召回率;误报代价大 → 高精确率。

 

### 关键方法/流程

 

**混淆矩阵怎么画(2×2):**

 

```

            实际正(y=1) 实际负(y=0)

预测正 TP FP ← 预测阳性共 TP+FP

预测负 FN TN ← 预测阴性共 FN+TN

           实际阳性 TP+FN 实际阴性 FP+TN

```

 

填格思路:先看预测归哪类,再看实际归哪类,两个一致是"正解"(TP/TN),不一致是"错"(FP/FN)。

 

– **精确率 = TP ÷ (TP+FP)**:分母是**预测阳性那一行**(模型说了算的)

– **召回率 = TP ÷ (TP+FN)**:分母是**实际阳性那一列**(真实的正例)

– 记忆锚:精确率看"预测"那一行,召回率看"实际"那一列

 

**trade-off 决策标准:**

 

```

漏报(假阴性)代价大 → 优先高召回率 → 调低阈值(如罕见病筛查,宁可多误报也别漏诊)

误报(假阳性)代价大 → 优先高精确率 → 调高阈值(如判刑 / 放贷,宁可放过也不冤枉)

```

 

俗语对照:"宁可错杀一千,不可放过一人" = 高召回(宁杀错不漏);"宁放过一千,不错杀一个" = 高精确。

 

### 实战记录

 

– 出题验证 4 道全部通过:#84 项目流程、#85 公平伦理、#86 精确率 vs 召回率、#87 权衡

 

 

## 线索区(学完后合上材料,自问自答)

 

**Q: 听的时候明白,但做的时候画不出混淆矩阵表格**

A: 只记住了两个定义,没建立 2×2 表格的心智模型。先把预测/实际两类各占一行一列,把 TP/FP/FN/TN 四个数字填进去,指标就是同一个 TP 除以不同的一行(精确率)或一列(召回率)。

 

**Q: 阈值升高为什么精确率升、召回率降?("预测失败的内容少了,那么召回其实就很难召回,这就是为什么召回率和准确率负相关")**

A: 阈值调高 = 更保守,只有很确定才判阳性 → 预测阳性变少,精确率升;但真阳性被漏掉更多,召回率降,二者负相关。(用户说的"准确率"应为"精确率",本课未讲准确率指标。)

 

**Q: 什么时候优先高精确率、什么时候优先高召回率?(用户推导:"看漏报和错报的代价哪个大,漏报代价大那就一定要召回,报错代价大就必须准确")**

A: 看哪种错代价大,不是看占比。漏报(假阴性)代价大 → 高召回率(如罕见病筛查,漏诊要命);误报(假阳性)代价大 → 高精确率(如错判罪、错放贷)。

 

**Q: 患病例子为什么优先高召回率而不是高精确率?**

A: 罕见病筛查最怕漏诊——真得病没被发现有生命危险。宁可多误报(让更多人来复查),也不漏掉一个病人。

 

## 总结(50字以内,用自己的话概括今天学到了什么)

 

ML 项目是迭代循环;偏见来自数据要防;偏斜数据看精确率召回率,混淆矩阵一张表记牢;漏报代价大高召回,误报代价大高精确。

 

 

## 复习卡片

 

| 概念 | 一句话 | 我的场景 |

| ———— | ————————————– | —————————— |

| 项目完整循环 | 定义→数据→训练→上线→反馈→回上一环 | "不好就回上一环节重来" |

| 偏见根源 | 训练数据带历史偏见,模型学走 | "数据有问题,对特定人群不公平" |

| 混淆矩阵 | 2×2 表,精确率看预测行,召回率看实际列 | "一张表走天下" |

| 精确率 | 模型说阳性的里,真的占几成 | "模型说了算的那一堆" |

| 召回率 | 真实阳性里,抓到几成 | "真得病的抓到了几成" |

| 决策标准 | 漏报代价大→高召回;误报代价大→高精确 | "宁可多误报也别漏诊" |

赞(0)
未经允许不得转载:171主机测评 » 准大二学生从0开始学AI——机器学习Day15
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址