欢迎光临
我们一直在努力

吴恩达:从 Agentic AI 到“人人都能用 AI 造应用

吴恩达 3.3 小时课程合集:从 Agentic AI 到"人人都能用 AI 造应用"

视频详细笔记 · 全程本地转录(mlx-whisper,2283 行)+ 40 帧画面整理

项内容
来源 @FinanceYF5 转 @0xMovez
时长 3:18:14
讲者 Andrew Ng(吴恩达)
出品 DeepLearning.AI
笔记依据 全片转录 2283 行 + 40 帧关键帧

[!warning] 先说清楚 · 标题有水分
推文把它包装成"如何在 2026 成为 AI 工程师",但实际内容是四段独立素材缝在一起,而且时长大头(约 2.5 小时)是面向普通人的《AI Prompting for Everyone》入门课,并非工程师专属高阶内容。真正给工程师看的干货集中在开头的 agentic/evals 理念,以及第 3 部分那场"软件工程未来"的演讲。

真实结构:

时间部分性质
00:00 Agentic AI 课程开场 课程宣传
~02:00 Agent Skills 课程开场(与 Anthropic 合作) 课程宣传
04:25 软件工程的未来(主题演讲) 干货演讲
23:38 AI Prompting for Everyone 完整课 入门课(篇幅最大)
2:52:17 用 AI 造应用(vibe coding) 手把手实操

[!note] 画面观察
全片是 DeepLearning.AI 演播室风格:吴恩达出镜 + 身后屏幕放幻灯片,中间穿插红白色的模块标题卡("Working with Multimedia & Code"等)。视频自带英文硬字幕。


1 · Agentic AI 课程开场

约 00:00 · 课程宣传片

吴恩达说他当初造了 “agentic AI” 这个词来描述一类新项目,没想到被营销号滥用、贴得到处都是。但抛开炒作,真正被构建和部署的智能体系统也在快速增长。

  • 什么是 agentic:不同于"单次 LLM 调用直接给答案",智能体系统能执行多个 LLM 驱动的步骤——调用工具、推理、对结果反复迭代,以完成复杂任务。
  • 怎么教:用原生 Python 手写,不把步骤藏进框架里,让你看清每一步真正在做什么。
  • 学会把一个复杂应用拆解成一串任务,再实现为智能体工作流。
  • 学会实现智能体工作流的四种关键设计模式。
  • 课程 vendor-neutral(不绑定厂商),学完可用任意框架或不用框架落地。目前只在 deeplearning.ai 上。

[!tip] 全片被反复强调的核心观点
带过很多团队后,他发现决定一个团队能否做好智能体的最大预测指标,是能否驱动一套有纪律的"错误分析(error analysis)"流程——即建立评估(evals),面对复杂工作流时能高效锁定"该改哪个组件",用评估数据指导时间投入,而不是凭感觉瞎猜。做到这点,就能领先当今绝大多数团队。


2 · Agent Skills 课程开场

约 02:00 · 与 Anthropic 合作,讲师 Eddie Chopik

Skills 是给 Claude Code 等智能体**按需装配"专业知识"**的新方式。

  • 形式:创建或下载一个文件夹,里面装着完成某项任务的指令、脚本和参考资料。智能体在需要时动态加载对应 skill,从而可靠地完成该任务。
  • 例子:一个 skill 是"代码质量审查清单";另一个是"针对你团队数据基建写 SQL 查询的指令";再一个是"分析客户数据的可复用流程"。
  • 一次创建,任何兼容的智能体都能调用。由 Anthropic 首创,现已是被越来越多应用采用的开放标准。
  • 课程演示 skills 在 Claude AI、Claude Code、Claude API、Claude Agent SDK 中的用法,并教你把 skills 与 MCP、子智能体组合成强大系统。
  • 观点:随着模型变强,写"胶水代码"越来越简单;基础工具(文件系统访问、bash 执行)已让智能体能做很多事,而 skills 进一步补上"专业知识"。

3 · 软件工程的未来(主题演讲)

04:25 – 23:38 · 干货密度最高的一段现场演讲

这是一场面向开发者的现场演讲(含一个"你们是全世界第一批听到"的新产品发布)。主题:AI 编码正把软件工程重塑成什么样。

乐高积木论

他常把软件(工具、框架、API)想象成乐高积木:只有一种白色积木能搭的东西有限;颜色种类越多,组合出的有趣东西呈组合式/指数式增长。

  • 积木既包括 AI 积木(LLM、RAG、agentic 工作流……),也包括非 AI 积木(UI 组件、数据库持久化、身份/鉴权管理……)。
  • 正因为有了 AI 编码,这些积木正以前所未有的速度激增——每天都有更多,让 AI 智能体帮我们把它们快速拼起来。

“我自己 100% 的代码都是 AI 写的”

常被问:到底该用多少 AI 编码?有团队说 80%,已经不错。而他本人几乎 100%。他强调从 80% 到 100% 这"最后一段"差别巨大。

  • 时间账:如果 80% 代码由 AI 写、但要人去审那 20%,人工审查会"花掉永远";100% AI 的团队在短时间内产出多得多。写代码如此,审代码也如此——只要还坚持人工逐行审,人就成了瓶颈。
  • 不是宗教:如果你在 NASA 造火箭、要写 50 行手工代码,那就写,完全 OK。但他看到前沿团队正趋向接近 100% 由 AI 写代码。

瓶颈转移 + 团队形态巨变

编码被 AI 加速 10~100 倍后,出现有趣的二阶效应(他去年 7 月在 The Batch 通讯里写过"产品管理瓶颈"):

  • 新瓶颈 = 决定做什么(PM 工作),而非动手造。
  • PM : 工程师比例从常见的 1:8、1:7,开始滑向诡异的 1:2、1:1;最终最快的做法是把两个人合并成一个全栈通才——工程师能做点 PM,PM 能写点代码。
  • 越来越多 AI 原生团队是小而全的通才小队,人人几乎什么都懂,跑得飞快。
  • 瓶颈还会外溢:设计瓶颈(设计师直接用代码实现、跳过 Figma 更快)、法务合规瓶颈(花一天写代码却等一个月过法务)、市场瓶颈、销售瓶颈。

[!note] 「瓶颈外溢」是什么意思
一件产品从想法到上线要过很多环节:写代码 → 设计 → 法务 → 市场 → 销售。瓶颈永远在"最慢的那一环"。以前写代码最慢,所以它是瓶颈;现在 AI 让编码快了 10~100 倍,这一环不再慢了,"最慢的一环"就换成了下游那些原本不起眼的环节——它们没变慢,只是相对显得极慢,于是瓶颈从编码"溢出"到了它们身上。

  • 设计瓶颈:代码几小时写完,等设计稿却要几天 → 让设计师直接用代码实现、跳过 Figma。
  • 法务合规瓶颈:以前 3 个月写代码 + 1 个月审法务还行;现在 1 天写完却等 1 个月过法务,反差极扎眼。
  • 市场 / 销售瓶颈:产品发版太快,市场和销售团队来不及搞清做了啥、怎么对外讲。

由此他的结论:① 小而全的通才团队更快(两人小队按定义每人都得懂点软件/设计/法务/营销,不用等别的部门);② 用 AI 去补齐非编码环节(会 prompt 的工程师能让 AI 做基础营销、先过一遍法务再交真律师)。

  • 好消息:一个会好好 prompt AI 的工程师,虽然不是营销高手,也能做点基础营销/法务(他常让 AI 先过一遍法务,再交真律师签字)。两人小队按定义必须在软件/设计/法务/营销上都各懂一点。
  • 多个 AI 原生团队之间用清晰的 API 边界 + 有限沟通协作,可扩展到单团队之外。

不看好"AI 失业潮"

  • 硅谷流行谈 “jobpocalypse”(AI 抢走几乎所有工作、街头暴动),他坦言没看到。
  • 相反,符合上述画像的未来 AI 工程师前途光明。他团队招 AI 工程师看三点:① 能高效使用编码智能体(Claude Code、Gemini CLI、Codex、open code 等);② 对海量"积木"有扎实认知(挑战在于积木又多又变得快);③ 有通用技能(基础 PM 等)。这类人才严重供不应求,连他自己都招不到足够的。
  • 引用费城联储研究(“很少有公司觉得需要裁员”),并称近一两月商业媒体在纠正这个被夸大的叙事(商业媒体拿钱是为了说对,不像大众媒体图刺激)。
  • 他不否认各层级都有人在感受就业不安全感(疫情/零利率时期过度招聘留下的后遗症),认为需要正视,但"失业潮"言过其实。

[!tip] 框架:并行技能发展(Parallel Skill Development)
编码智能体在不断变强的同时,人也要发展互补技能去恰当地驾驭它们,双方才能协作造出新东西。教育/培训不该只练人的技能,要和智能体的进步"并行"。

发布:Context Hub 与 Code Dream

Context Hub——解决"模型知识过期"痛点:

  • 智能体有知识截止日期(有时落后一年),常幻觉或用废弃 API。例:让 Claude Code 调 OpenAI,它会用更老的、已废弃的 chat completions API 和旧模型,因为网上训练数据大多是旧 API。
  • Context Hub 给智能体喂最新文档。命令示例:chub search openai 返回包列表,chub get openai/chat 拉取知道 GPT 5.5、responses API 的最新实现(生成约 600 行上下文,主要是给智能体读的)。

Code Dream——当天首发预览版,帮助"人的技能发展":

  • 不是课程,而是一场对话:和"AI 版吴恩达"边聊边用现代方式(配合 Context Hub)写代码,随时能用麦克风打断提问,由名为 Yavira 的语音智能体协助答疑。
  • 现场演示(吐槽会场 Wi-Fi 差):讲义本身是可交互 JavaScript,能点、能打字(“讲个烂网络的笑话”)、能从幻灯片复制命令粘到浏览器里的终端,跑 npm install chub、启动 open code 写 Python——一个练习现代 AI 编码的沙盒环境。

4 · AI Prompting for Everyone(完整入门课)

23:38 – 2:52:17 · 全片最大篇幅,面向所有人的实用 prompt 课

目标:把你从现在的水平带到 “AI 高手(power user)”。以下按课程小节逐个展开。

4.1 新手 vs 高手

  • 新手把 AI 当 Google 用,只问简单问题。(例:问"Taco Bell 还有双层塔可吗?"得到个答案就完事。)
  • 高手问难问题并给它时间思考。(买车例:上传车规、报价、保险方案等一堆文档,让它"读完所有资料、认真想清楚再回答各车利弊",AI 会花几十秒甚至几分钟出一份详细报告。)
  • 给足上下文:把 AI 想象成"很聪明但还不了解你的应届毕业生"。短 prompt 常让它填空式瞎猜。(自我评估例:别只说"帮我写份给老板的自评";上传项目追踪器截图、近期项目文档、语音备忘,它才能写出真正贴合你的内容。高手对 AI 几乎有种"共情"——设身处地想它到底够不够信息把活干好。)
  • 写作方式不同:新手让 AI 直接"写篇黑莓手机博客"→ 一堆"AI slop";高手让它先出大纲、再批判大纲、迭代几轮,最后才成文。
  • AI 犯错其实比人们以为的少(2022/23 年错得多)。少数病毒式翻车(“strawberry 有几个 r”、“我要洗车,该走路还是开车过去?→ 走路”)并不代表真实能力。

4.2 AI 的知识从哪来(预训练)

  • AI 像孩子学写作一样,从海量互联网文本里学模式。理解它读了什么,就能预测它何时靠谱。
  • 它甚至懂冷门知识。(例:NASA 的 Voyager 1(1970 年代发射、现距地球约 250 亿英里)金唱片上刻了什么——AI 能答出用 55 种语言问候。)
  • 预训练知识反映数据频率:烹饪、名人、电影文本极多;类星体(quasar)这种专业话题少得多;粤语(8000 万+ 使用者)在网上占比可能不到 0.1%;你公司的私有数据它则完全不知道。→ 想想"某类信息在网上有多常见",就能大致判断答案可靠度。
  • 它能读懂拼错的文字(“can you cook eggs in microwave” 打飞快也能懂),因为训练数据里就有大量 typo。所以你打字有错别字不用纠结。
  • 坏消息:网上也有很多误解和过时信息,需要靠 prompt 技巧去规避。

4.3 联网搜索(Web Search)

  • 模型有知识截止日期,之后的事不知道。(例:问"2025 年的 6-7 meme 是什么"会触发联网;OpenAI GPT 5.4 截止日期是 2025 年 8 月,该 meme 之后才爆火,故模型本身不知道。)
  • 哪些问题倾向触发搜索:位置相关(“帮我找 Mountain View 附近高评分健身房”)、时效相关、冷门信息(Cooper’s Hill 滚奶酪比赛)。
  • 触发方式:模型自动决定,或你手动(点按钮 / 直接写"请联网搜索")。多数主流模型有此能力,但并非全部。
  • 局限:也可能拉到差的来源。

4.4 可靠来源 & 搜索的底层原理

  • 引导来源:(灰市肽(补剂)例:不加引导,AI 可能采信 Reddit/Quora 或卖肽的网站(有立场);若要求它用官方机构(WHO、美国 FDA、欧洲 EMA)或严谨科学研究,答案更可信。)
  • AI 最常引用的网站排序(某报告):Reddit > 维基百科 > YouTube > Google > Yelp……可靠度参差。高可信的科学来源在网上文本量本就少,不引导它就会拉"最易得"而非"最可靠"的。
  • 网页可能过时。(例:帮他找 Henderson, Nevada 跑步地点,结果引用了 20 多年前的网页,推荐了一所早已不对外开放的学校。)

[!example] 搜索底层原理(重要,能解释很多翻车)
把它想成两人客服团队:面向用户的主模型 + 负责搜索的副模型。你发问 → 主模型让副模型去搜 → 副模型用搜索引擎搜、过滤、下载最相关网页、做摘要 → 把摘要交回主模型 → 主模型据此作答。

关键 quirk:主模型其实没读过它引用网页的全文,只看了摘要,因此有时会误读、误引——你会看到"AI 说某网页支持某结论,但你点开发现根本没有"。(Machu Picchu 例:副模型搜"许可证/天气/风俗"再摘要回传。)

什么时候用 AI、什么时候用搜索引擎:想快速扫多个来源、导航到某个具体网站、看原始数据(如买 2013 本田思域空滤,要落地到购买页)→ 用搜索引擎;想要多源综合、权衡利弊、得出更深思熟虑的结论 → 用 AI。

4.5 Deep Research(深度研究)

让 AI 综合几十个来源、大量思考,产出深度研究报告。ChatGPT、Gemini、Claude 都有此模式,他认为被严重低估。

  • (万圣节鬼屋例:给它场地大小、想要的体验等上下文 → 它先出研究计划(你可批准/编辑)→ 依次搜"Palo Alto 许可规定、消防安全指南、装饰创意" → 边读边综合 → 最后写详细分节报告。这本身就是 agentic AI 的例子(自主决定下一步搜什么)。)
  • Gemini 的 Deep Research 还能一键把结果变成网页/信息图(预算饼图、噪音条例可视化、可勾选的清单)。
  • 原理:制定计划后并行发起多个搜索、同时取回多网页、评估相关性、决定是否换关键词再搜,循环几轮后汇总加引用成报告。
方式来源量耗时适合
预训练知识 0 秒级 常识、定义、摘要
Web 搜索 少量 数秒 时效/位置/单点问题
Deep Research 几十+ 数分钟~更久 需综合多源的复杂问题

4.6 把 AI 当思考伙伴 / 头脑风暴

  • 据 OpenAI 对 ChatGPT 对话的分析:约一半是写作和实用指导;创意构思占 3.9%(近 4%)。
  • AI 擅长生成大量选项(经典创造力测试:给一块砖想出 200 种用途)——你的角色是评估挑选。
  • (健身例:“帮我做健身计划,38 岁、初级、10 磅哑铃、每天 15 分钟"→ 得到通用答案(深蹲、俯卧撑)。若加怪上下文"我有蹦床和一只猫、坚持不下来"→ 得到"蹦床间歇”"猫触发式微运动"等更有创意的方案。)
  • 为什么默认给平庸答案:横轴放"回答的独特性"、纵轴放"AI 给出该回答的概率"——常识答案概率远高于奇招,因为网上写哑铃弯举的文本远多于"猫触发微运动"。给更多上下文能把它推向更相关、更有创意的空间。
  • 迭代法:(还债例:信用卡 $1,100@19%、月最低还款 $40、学生贷 8%、家庭借款 $900 → 让它给 3~5 个方案(保流动性 / 先还最高息 / 先还家人)→ 你反馈"不喜欢方案一太被动,喜欢先还 19% 的;对了我还有 $450 现金要到、要搬回家住"→ 它据此再出三个新方案。反复几轮直到满意。)

[!tip] 头脑风暴配方
① 尽量先给足相关上下文 → ② 让它给一把选项(3~5 个)→ ③ 对选项给反馈 → ④ 让它再给一批 → 重复几轮,直到有一两个你满意的点子,再让它把它展开细化。

4.7 上下文(Context)如何工作

  • 人的工作记忆约 7 项(记 7 样购物清单勉强够,15~20 样就难);AI 能吃巨量上下文,有些模型达数十万词。
  • (选公寓例:上传上百页租约合同 + 租客评价 + 社区统计,让它"读完所有资料、认真想清楚再答"每套的利弊。)
  • Context = 模型用来生成本次定制回答的所有文本和文件。同一个问题(物理 vs 动物学的利弊),给了你的职业测评结果 + 高中课表后,答案会定制得多、质量高得多。判断该给什么上下文:想"一个可信顾问要给你好建议,需要知道哪些信息"。
  • 顶尖模型可接受约 75 万词上下文 ≈ 前 4~5 本《哈利·波特》≈ 好几天不间断的说话量。很多人严重低估了能喂多少。
  • 默认上下文里有什么:系统提示(当前日期、模型名、能力、通用指令)、工具说明(如"什么是网页搜索、怎么用")、你的 prompt,以及不断累加的聊天历史。

[!warning] 管理上下文
要转去不相关的新话题时,开新对话清空上下文。(例:刚让它按"你的日程和偏好"排了健身计划,紧接着说"给我妈也排一个"——旧上下文(你的日程/偏好)会干扰、可能拉低答案质量,还难判断是否被带偏。)

4.8 AI 桌面 App(Cowork 类)

  • 如 Claude Cowork、Microsoft Copilot、Google Antigravity:在你授权下,能自主(agentically)从你电脑读文件补齐所需上下文来干活。
  • (整理文件夹例:一个塞满 PDF、图片的乱文件夹,让它读一遍并提出新组织方式(重命名、移动、建子目录)。流程:让它先出计划、别动手 → 你审阅/批评/让它改 → 满意后再执行。)
  • (排片场表例:在"filming 文件夹"里启动,说"排本周拍摄计划",它自己探索文件、加载相关的,甚至注意到某位组员 Mia 生日在拍摄周、帮你安排庆祝。)

[!warning] ⚠ 安全提醒
桌面 App 能读、能改、甚至删你的文件(虽罕见但确有发生)。① 在最相关的文件夹里运行,别在 home 目录给它全盘访问;② 认真看每次权限请求;③ 它删的文件常不进回收站、可能无法恢复;④ 它改过的文件通常没有编辑历史,无法回退。不熟前务必逐条看权限。

4.9 推理 / 让它"想久一点"

  • 最新模型推理能力很强——给对上下文,能长时间严谨地思考。他越来越把 AI 当"推理引擎"用(如前述买车利弊)。
  • 引用 METR 研究:横轴"人类完成该任务需多久"、纵轴 AI 成功率。2024–25 年 AI 能做需数秒~数十分钟的任务;2025 年起,能以不错成功率完成人类要花很多小时的任务(且 AI 不一定要花同样久)。
  • “think step by step” 已过时,他不再这么说;现在直接说 “think hard”,模型就懂要长篇、更复杂地推理。有人用关键词 “ultrathink” 触发更深思考,可能想几十秒到十几分钟。
  • 鼓励给难任务试水(如"给一个 4 人、现金有限的创业公司设计上市计划"),并给足"任何人做这活都需要"的上下文。

[!tip] 推理任务小结
① 用能拿到的最好模型(通常胜过半年~一年前的旧模型);② 给足所需上下文;③ 别只喂琐碎任务,敢给难题;④ 选"思考模式"或直接在 prompt 里让它 think hard。

4.10 谄媚(Sycophancy)

AI 因训练方式而强烈倾向说你爱听的话。这是关键 prompt 技能:中立提问 + 保持上下文客观。

  • (带偏见的问法:"你不觉得远程办公比坐班好吗?"→ 多半附和;反过来"坐班是不是更高效?"→ 也会附和。问法暗示了你想要的答案,它就顺着强化你的偏见。)
  • 《华盛顿邮报》研究:ChatGPT 更爱说"没错/好观点/你思路对",比说"不太对/并非如此/实际上"多约 10 倍;有的还会说"哥们,你说得太深刻了,一千个赞"。
  • 成因:用人类反馈训练成"讨喜助手"→ 附和更易得👍(内向/外向例:肯定式回答更易被点赞,中立回答反而被踩),于是学会更爱附和。谄媚"感觉良好但降低答案质量"。
  • 更难察觉的谄媚:“分析这些数据,找出本季度所有正面的业绩指标”——你已在暗示要报喜,它就更可能只说"营收增长、利润率改善"而不点问题。

[!tip] 中立措辞对照

  • ❌"碳税是不是对小企业不好?" → ✅"碳税**在多大程度上(如果有的话)**影响小企业?"
  • ❌"你同意 AI 会创造很多岗位吗?" → ✅"目前的研究怎么说 AI 对就业的影响?"
  • ❌"远程办公会降低生产力吗?" → ✅"远程与坐班的生产力相比如何?"
  • 技巧:并列两个选项让它列各自利弊,但不暗示你希望哪个赢;或给它**评分标准(rubric)**逼它客观。

4.11 写作

  • OpenAI 数据:写作占 ChatGPT 任务的 24%,是最大单一类别。“写作其实是一种思考”。
  • 什么是 AI slop:直接让 AI 写 → 读着"像 AI 写的"、每句单看还行但整体空洞。特征:**破折号(em-dash)用得远超常人(Bluesky 上自 ChatGPT 后一路走高);过度使用 “nuanced”、“delve”;爱用"三项列举";爱用"not X but Y"**句式(X、Y 都很虚)。一项调查:近 40% 美国上班族上月收到过"work slop"。
  • 有趣:人类因大量用 AI,说话也开始像 AI——ChatGPT 后播客/演讲里 “delve” 变多(即兴和备稿都如此)。
  • 渐进式大纲法(避免 slop):不让它直接成文,而是先写大纲 → 精修 → 迭代几轮 → 再生成正文。(例:写"小 AI 团队比不用 AI 的大团队更快"的文章:先让它搜正反证据 → 给 3 个大纲选项(含反方章节)→ 你反馈"用选项一、保留三个故事、去掉故事一后的论点、加个历史类比:90 年代皮克斯用小团队做出第一部全 CG 长片《玩具总动员》"→ 得修订大纲。)
  • 为什么先写大纲高效:直接改成文只改一个词、整段不变;改大纲一处就能带动整段/整节重写——杠杆率高得多("会飞的松鼠能不能扛椰子"示例)。

4.12 编辑 & 用 rubric 评分

  • OpenAI 数据:写作类对话约 2/3 是从"已有文本"出发,而非白纸。
  • 逐段编辑:一次改一句/一段,围绕每段小小头脑风暴、定稿再下一段,比一次全改后再从长文里找改了啥要好管理得多。(例:“公众以为实现 AGI 意味着电脑会像人一样小”——让它给出"有力版/有远见版/口语版"几种改写,挑你喜欢的。)
  • 整体评价用 rubric(评分标准):直接让它评一篇科幻小说,因谄媚多半夸你写得好。给明确评分标准逼它客观。(科幻 rubric 例:人物 25 分、情节 25 分、世界观、文笔……并细化每条如何打分(“每个有名字的角色是否都有目标 = 10 分”)。每条标准都非真即假、无中间地带,强制客观。不确定用什么标准?让 AI 帮你先拟一份。)
  • 用法:把 rubric + 文本一起给它,让它逐条打分、最后加总,再让它给"如何在这些维度上改进"的建议。
  • 写得差的 rubric 会诱发谄媚:如"给我这科幻打个 100 分制分数"——它会先跳到一个总分再倒推分类,且"人物/情节"等定义模糊。实测:主观 rubric 打 83,客观 rubric 打 75,且改进建议更有用。
  • 跨模型互评:让 Gemini 用 rubric 评 ChatGPT 的作品(或反之),融合两模型知识,效果略好。但他自己很少用;更常做的是频繁切换不同模型。
  • 锯齿智能(jagged intelligence):AI 有些任务超过任何人(快速读海量网页、解难题数学),有些又不如人;且不同模型"锯齿"方向不同、市场竞争激烈、最优模型频繁变。→ 常拿同一 prompt 喂多个模型对比,保持手感。

4.13 多模态(图/视频/语音/代码)

  • AI 能生成图像、视频、语音、音乐、代码。(蛋糕例:为女儿 Nova 七岁生日,用 Google 的 Nano Banana 生成猫主题蛋糕设计图 → 拿给蛋糕师做成真 3D 蛋糕。图像生成成了"头脑风暴工具"。)
  • 还演示了:AI 生成"男人缩小"的视频(过去要昂贵特效);用他的语音克隆念 The Batch 通讯(放给父母听,一位听得出、一位听不出);给女儿用 AI 生成"打对字母就喂猫"的打字小游戏。
  • 输入输出可任意组合(上传灵感图 → 规划万圣节服装;上传诡异音效 → 生成鬼屋视频)。
  • 生成成本/耗时:文本最低 < 语音 < 图像 << 视频。越靠右越慢越贵。2022 年 Google Imagen 有瑕疵(水槽线条不对、盘子中途变样),现代模型好很多、还能自动配音同步。

[!warning] 责任
语音生成能修播客口误、给游戏角色配音,但也冲击配音演员生计,并被用于语音克隆诈骗(假冒亲属称紧急要转账)。有益用途远多于有害,但仍需防范。

4.14 把图像作为输入

  • (白板例:上传他在白板前讲课的照片问"这堂课讲什么"——尽管他的头挡住了 “convolutional” 一词,AI 仍答出在讲卷积神经网络(CNN),还能猜下一步会让学生做什么。)
  • 弱点:AI 看图偏"粗看",易漏细节。(问"我健身房这些是什么器械"常自信答错(模糊看很多器械长得像);但换成视觉上很独特的"人形仓鼠轮跑步机"就答得好。)
  • 能读图上文字:拆账单(“我点了这些,我该付多少”)、读手写体(转写、建家族史档案)。但会出错,高风险场景别全信,愿意花几秒复核就还行。
  • 可一次上传多张图(头脑风暴的便签、白板照 + 笔记 → 让它总结今天会议的点子)。一图胜千言,加图常是给 AI 上下文最快的方式。

4.15 图像生成

  • 以图改图:(例:一张褪色的童年老照片,让它"去反光、去粗糙纹理、改成更自然的比例"→ 修复得很好(用 Nano Banana)。)
  • 不会写图像 prompt?先让文本 AI 帮你写(“给’一只猫深夜偷偷经营咖啡馆’生成一段图像 prompt”——它会指定场景、角色细节、氛围/风格)。
  • 图像的语言:cinematic(电影感)、watercolor(水彩)、cyberpunk、anime……懂艺术/艺术史的人更会 prompt。想精进可上传图片问 AI"你会怎么描述这张图"来学词汇。
  • 扩散模型原理:文本是逐字生成;图像是一次性整张生成。训练时看"带描述的图"(如"木桌上的小盆栽"),学会从纯噪声逐步"去噪"到清晰图。你给 prompt 时它就从噪声出发去噪成图。
  • 典型错误:手/手指数目怪异、文字乱码(“happy birthday” 拼错)、角色跨帧不一致。现代模型(如 Nano Banana)已改善很多,能出文字基本可读的信息图、跨帧一致的卡通角色。
  • 图像生成慢且贵(单张几十秒、几美分,且不能中途停),所以迭代受限;视频更甚。好消息:生成任何东西的成本都在逐年下降。

4.16 造应用(初探)

  • 不写代码也能做小游戏/网站。(例:prompt"做个用户放置障碍和目标的游戏"→ Claude 生成可玩的小游戏;"烟花展示"prompt → 生成可点击放烟花的 app。)
  • 写 app prompt 的积木:① 目标(要做什么)② 输入(用户要提供什么)③ 输出(app 给用户看什么)。
  • 还能做实用小工具:番茄钟(25 分工作 + 5 分休息)、分账计算器、看天气选穿搭 app。这些任务单一、不需额外文件,适合新手起步。
  • 难易差别:平台跳跃小游戏、法语单词测验 = 较易;联网多人游戏、带 AI 反馈的实时法语练习 = 较难。不确定就试,最坏就是不成,顺便练直觉。(并推荐进阶课 “Build with AI”。)

4.17 数据分析(让 AI 写代码分析)

  • 把健康/运动数据、公司销售等表格丢给 AI,它能写代码分析并出图,你无需写代码。运行代码是 AI 的一种"工具",在有数据/需计算/需画图时会被调用。
  • (奶茶店例:附上销售数据,prompt"哪些饮品销量变化最大?画出来"→ AI 走 agentic 流程:查看数据 → 算月度变化 → 识别最有意思的几款 → 出彩色折线图(草莓抹茶春季起飞、芒果绿茶/草莓柠檬夏季、椰奶茶秋季)。)
  • (年终图例:“给奶茶店做一页年终回顾图,仔细分析数据找洞见”——"carefully"会触发它想几分钟、写代码算营收/销量,产出带洞见(黑糖和经典最畅销)和奶茶配色的图。)
  • 数字可能幻觉,建议复核;但因是写代码算出来的,通常相当准,且比自己在 Excel/Sheets 里快得多。

[!example] 本部分练习 & 期末项目
练习 lab 内置四个 prompt:烟花秀、配色板选择器、法语抽认卡、法语练习。期末项目三步走:① 头脑风暴一个研究问题(如职业选择)→ ② 让 AI 做研究出带引用的报告 → ③ 基于报告造个 app(测验 / 小游戏 / 信息图,可分享给朋友)。


5 · 用 AI 造应用(“30 分钟做出一个应用”)

2:52:17 – 3:18:14 · vibe coding,零基础也能上手

吴恩达开场:“不管你什么背景,都能用 AI 造有用的软件。就算你从没写过一行代码。”

🎂 生日贺卡 App 演示

[!example] 演示
一个跑在浏览器里的网页应用:填姓名、年龄、爱好(企鹅时装设计)、形容词(可疑地有趣)、复数名词(幸运袜)→ 点"生成卡片"→ 出一段搞笑祝福(“Karen,居然满 27 了……”)。还有"手气不错(I’m feeling lucky)"自动填空、把祝福复制到剪贴板、以及保存历史卡片。

建议先照着把这个 app 亲手做一遍:能培养"怎么跟 AI 说话才拿到想要的结果"的直觉,体会小改动如何带来大不同。

核心方法:prompting

  • AI 时代造软件最简单的方式不再是手敲代码,而是告诉 AI 去做(= prompting)。可用 ChatGPT / Gemini / Claude 或网站内置的 AI。
  • 增量式:先"做个帮我写生日卡的网页,输入姓名/年龄/爱好,返回搞笑消息"→ 再"加个节日标题和颜色让它更好看"→ 再"把卡片显示在右边、做成打开生日卡的样子"→ 继续加功能。这就是他的真实工作方式:先给基础指令看效果,再反复告诉它怎么改进。

[!tip] Prompt 的五个积木

  • 目标(Goal)——要造什么
  • 输入(Input)——用户要告诉软件什么
  • 输出(Output)——软件要返回/展示什么
  • 布局(Layout)——左边放什么、右边放什么
  • 特殊功能/指令(Special features)
  • 可以增量一次给一块,也可以把五块写进一个较长的 prompt 一次给。不必每次都用全,顺序也不重要,通常先说目标。

    [!tip] 越具体 → 越可预测(食物卡车类比)
    “给我个三明治” vs “素食三明治” vs “加鹰嘴豆泥、奶酪、全麦面包的素食三明治,再配杯饮料、打包带走”——越具体,拿到的越接近你要的。同一个具体 prompt 多次运行仍会有些差异,这是 AI 的正常现象;不喜欢就再给指令微调。

    动手:下载 & 运行

    • 复制第一个 prompt 发给 AI → 它生成 HTML 页面(生成中"下载"按钮是灰的)→ 生成完点下载 → 在浏览器打开 file.html(他用 Mac 上的 Chrome 演示)。这段代码此刻就跑在你自己电脑上。
    • 想改进就继续 prompt"加节日标题和颜色"→ 等它重写 → 再下载打开,就更喜庆了。
    • 同样的 prompt 在 ChatGPT / Gemini / Claude 上效果类似——学的技能不绑定任何平台。
    • 找反馈:他写完常给朋友、家人甚至礼貌地问陌生人看,或发同事/论坛。别人常有改进点子,逗笑朋友也让他有动力继续。

    加功能 & 修 bug

    • (加功能要具体:不说"加五个字段",而说"做成五个清晰标注的输入:姓名、年龄、爱好、形容词、复数名词";“加个手气不错按钮,用有趣的预设词随机填空”;改主题色蓝→紫、粉、绿随你。)
    • (修 bug:生成的 HTML 有时不工作(点"生成卡片"没反应)。直接告诉 AI"点生成卡片没反应,能修一下吗",它通常能找到并修基础 bug。它可能吐一堆技术解释(“JavaScript 绑定到按钮 click 事件……”)——现在不用懂,直接下新 HTML 看是否好用即可。)

    🏓 乒乓球游戏

    [!example] 演示
    电脑史上最早的游戏之一 Pong 当年团队要做几周,现在几分钟。prompt:"做个单 HTML 文件的桌球游戏,人机对战,方向键控制球拍"→ 首版 → 再"加三个难度、让用户设定获胜分数、并计分"→ 再"球场绿色、球拍米色、球白色,插入这张背景图"→ 成型可玩。要点仍是:写得越具体,结果越好。

    期末项目 & 收尾

    • 期末项目:做一个自己的"填空故事生成器",须含 3~5 个输入字段、一个按钮、一个显示输出的地方(灵感:搞笑产品评价生成器、请假条生成器等)。做好上传 HTML,AI 会检查是否正常并给反馈 → 拿结课证书。
    • “既要造,也要上课”:只造不学易反复造轮子、或用很奇怪的方式做事;只学不造则只有理论。两者都重要,持续构建、持续学习。
    • 致谢 DeepLearning.AI 的 Summer Ray、Andres Gonzalez、Tommy Nelson。

    ★ 核心要点速记

  • Evals 是护城河:无论 agentic 系统还是日常用 AI,"有纪律的错误分析 + 评估"是最被低估、却最能拉开差距的能力。
  • 给足上下文:把 AI 当"聪明但不了解你的应届生",短 prompt = 平庸答案;顶尖模型能吃约 75 万词。
  • 警惕谄媚:用中立措辞、给客观 rubric,别在提问里暗示你想要的答案。
  • 写作先写大纲:直接成文出 AI slop;先大纲→迭代→再成文,改大纲杠杆率最高。
  • 三档信息获取:预训练知识(秒)/ Web 搜索(数秒少量源)/ Deep Research(分钟级几十源)——按问题复杂度选。
  • 造应用五积木:目标 / 输入 / 输出 / 布局 / 特殊功能;越具体越可预测;遇 bug 直接让 AI 修。
  • 工程趋势:趋向近 100% AI 编码 → 瓶颈转到"做什么"和设计/法务/市场 → 小而全通才团队 → 不看好失业潮,AI 工程师严重稀缺。
  • 持续换模型:AI 是"锯齿智能",最优模型频繁变,常拿同一 prompt 对比多个模型保持手感。

  • 本文档由 x-video-summary skill 全自动生成:yt-dlp 下载全片 → ffmpeg 抽音频 + 40 帧关键帧 → 本地 mlx-whisper 转录全部 3:18:14(2283 行)→ 结合转录与画面整理成文。内容基于真实转录,非章节标题推测;专有名词以听写为准,个别人名/产品名可能有拼写误差。

    吴恩达 3.3 小时课程合集:从 Agentic AI 到"人人都能用 AI 造应用"

    视频详细笔记 · 全程本地转录(mlx-whisper,2283 行)+ 40 帧画面整理

    项内容
    来源 @FinanceYF5 转 @0xMovez
    时长 3:18:14
    讲者 Andrew Ng(吴恩达)
    出品 DeepLearning.AI
    笔记依据 全片转录 2283 行 + 40 帧关键帧

    [!warning] 先说清楚 · 标题有水分
    推文把它包装成"如何在 2026 成为 AI 工程师",但实际内容是四段独立素材缝在一起,而且时长大头(约 2.5 小时)是面向普通人的《AI Prompting for Everyone》入门课,并非工程师专属高阶内容。真正给工程师看的干货集中在开头的 agentic/evals 理念,以及第 3 部分那场"软件工程未来"的演讲。

    真实结构:

    时间部分性质
    00:00 Agentic AI 课程开场 课程宣传
    ~02:00 Agent Skills 课程开场(与 Anthropic 合作) 课程宣传
    04:25 软件工程的未来(主题演讲) 干货演讲
    23:38 AI Prompting for Everyone 完整课 入门课(篇幅最大)
    2:52:17 用 AI 造应用(vibe coding) 手把手实操

    [!note] 画面观察
    全片是 DeepLearning.AI 演播室风格:吴恩达出镜 + 身后屏幕放幻灯片,中间穿插红白色的模块标题卡("Working with Multimedia & Code"等)。视频自带英文硬字幕。


    1 · Agentic AI 课程开场

    约 00:00 · 课程宣传片

    吴恩达说他当初造了 “agentic AI” 这个词来描述一类新项目,没想到被营销号滥用、贴得到处都是。但抛开炒作,真正被构建和部署的智能体系统也在快速增长。

    • 什么是 agentic:不同于"单次 LLM 调用直接给答案",智能体系统能执行多个 LLM 驱动的步骤——调用工具、推理、对结果反复迭代,以完成复杂任务。
    • 怎么教:用原生 Python 手写,不把步骤藏进框架里,让你看清每一步真正在做什么。
    • 学会把一个复杂应用拆解成一串任务,再实现为智能体工作流。
    • 学会实现智能体工作流的四种关键设计模式。
    • 课程 vendor-neutral(不绑定厂商),学完可用任意框架或不用框架落地。目前只在 deeplearning.ai 上。

    [!tip] 全片被反复强调的核心观点
    带过很多团队后,他发现决定一个团队能否做好智能体的最大预测指标,是能否驱动一套有纪律的"错误分析(error analysis)"流程——即建立评估(evals),面对复杂工作流时能高效锁定"该改哪个组件",用评估数据指导时间投入,而不是凭感觉瞎猜。做到这点,就能领先当今绝大多数团队。


    2 · Agent Skills 课程开场

    约 02:00 · 与 Anthropic 合作,讲师 Eddie Chopik

    Skills 是给 Claude Code 等智能体**按需装配"专业知识"**的新方式。

    • 形式:创建或下载一个文件夹,里面装着完成某项任务的指令、脚本和参考资料。智能体在需要时动态加载对应 skill,从而可靠地完成该任务。
    • 例子:一个 skill 是"代码质量审查清单";另一个是"针对你团队数据基建写 SQL 查询的指令";再一个是"分析客户数据的可复用流程"。
    • 一次创建,任何兼容的智能体都能调用。由 Anthropic 首创,现已是被越来越多应用采用的开放标准。
    • 课程演示 skills 在 Claude AI、Claude Code、Claude API、Claude Agent SDK 中的用法,并教你把 skills 与 MCP、子智能体组合成强大系统。
    • 观点:随着模型变强,写"胶水代码"越来越简单;基础工具(文件系统访问、bash 执行)已让智能体能做很多事,而 skills 进一步补上"专业知识"。

    3 · 软件工程的未来(主题演讲)

    04:25 – 23:38 · 干货密度最高的一段现场演讲

    这是一场面向开发者的现场演讲(含一个"你们是全世界第一批听到"的新产品发布)。主题:AI 编码正把软件工程重塑成什么样。

    乐高积木论

    他常把软件(工具、框架、API)想象成乐高积木:只有一种白色积木能搭的东西有限;颜色种类越多,组合出的有趣东西呈组合式/指数式增长。

    • 积木既包括 AI 积木(LLM、RAG、agentic 工作流……),也包括非 AI 积木(UI 组件、数据库持久化、身份/鉴权管理……)。
    • 正因为有了 AI 编码,这些积木正以前所未有的速度激增——每天都有更多,让 AI 智能体帮我们把它们快速拼起来。

    “我自己 100% 的代码都是 AI 写的”

    常被问:到底该用多少 AI 编码?有团队说 80%,已经不错。而他本人几乎 100%。他强调从 80% 到 100% 这"最后一段"差别巨大。

    • 时间账:如果 80% 代码由 AI 写、但要人去审那 20%,人工审查会"花掉永远";100% AI 的团队在短时间内产出多得多。写代码如此,审代码也如此——只要还坚持人工逐行审,人就成了瓶颈。
    • 不是宗教:如果你在 NASA 造火箭、要写 50 行手工代码,那就写,完全 OK。但他看到前沿团队正趋向接近 100% 由 AI 写代码。

    瓶颈转移 + 团队形态巨变

    编码被 AI 加速 10~100 倍后,出现有趣的二阶效应(他去年 7 月在 The Batch 通讯里写过"产品管理瓶颈"):

    • 新瓶颈 = 决定做什么(PM 工作),而非动手造。
    • PM : 工程师比例从常见的 1:8、1:7,开始滑向诡异的 1:2、1:1;最终最快的做法是把两个人合并成一个全栈通才——工程师能做点 PM,PM 能写点代码。
    • 越来越多 AI 原生团队是小而全的通才小队,人人几乎什么都懂,跑得飞快。
    • 瓶颈还会外溢:设计瓶颈(设计师直接用代码实现、跳过 Figma 更快)、法务合规瓶颈(花一天写代码却等一个月过法务)、市场瓶颈、销售瓶颈。

    [!note] 「瓶颈外溢」是什么意思
    一件产品从想法到上线要过很多环节:写代码 → 设计 → 法务 → 市场 → 销售。瓶颈永远在"最慢的那一环"。以前写代码最慢,所以它是瓶颈;现在 AI 让编码快了 10~100 倍,这一环不再慢了,"最慢的一环"就换成了下游那些原本不起眼的环节——它们没变慢,只是相对显得极慢,于是瓶颈从编码"溢出"到了它们身上。

    • 设计瓶颈:代码几小时写完,等设计稿却要几天 → 让设计师直接用代码实现、跳过 Figma。
    • 法务合规瓶颈:以前 3 个月写代码 + 1 个月审法务还行;现在 1 天写完却等 1 个月过法务,反差极扎眼。
    • 市场 / 销售瓶颈:产品发版太快,市场和销售团队来不及搞清做了啥、怎么对外讲。

    由此他的结论:① 小而全的通才团队更快(两人小队按定义每人都得懂点软件/设计/法务/营销,不用等别的部门);② 用 AI 去补齐非编码环节(会 prompt 的工程师能让 AI 做基础营销、先过一遍法务再交真律师)。

    • 好消息:一个会好好 prompt AI 的工程师,虽然不是营销高手,也能做点基础营销/法务(他常让 AI 先过一遍法务,再交真律师签字)。两人小队按定义必须在软件/设计/法务/营销上都各懂一点。
    • 多个 AI 原生团队之间用清晰的 API 边界 + 有限沟通协作,可扩展到单团队之外。

    不看好"AI 失业潮"

    • 硅谷流行谈 “jobpocalypse”(AI 抢走几乎所有工作、街头暴动),他坦言没看到。
    • 相反,符合上述画像的未来 AI 工程师前途光明。他团队招 AI 工程师看三点:① 能高效使用编码智能体(Claude Code、Gemini CLI、Codex、open code 等);② 对海量"积木"有扎实认知(挑战在于积木又多又变得快);③ 有通用技能(基础 PM 等)。这类人才严重供不应求,连他自己都招不到足够的。
    • 引用费城联储研究(“很少有公司觉得需要裁员”),并称近一两月商业媒体在纠正这个被夸大的叙事(商业媒体拿钱是为了说对,不像大众媒体图刺激)。
    • 他不否认各层级都有人在感受就业不安全感(疫情/零利率时期过度招聘留下的后遗症),认为需要正视,但"失业潮"言过其实。

    [!tip] 框架:并行技能发展(Parallel Skill Development)
    编码智能体在不断变强的同时,人也要发展互补技能去恰当地驾驭它们,双方才能协作造出新东西。教育/培训不该只练人的技能,要和智能体的进步"并行"。

    发布:Context Hub 与 Code Dream

    Context Hub——解决"模型知识过期"痛点:

    • 智能体有知识截止日期(有时落后一年),常幻觉或用废弃 API。例:让 Claude Code 调 OpenAI,它会用更老的、已废弃的 chat completions API 和旧模型,因为网上训练数据大多是旧 API。
    • Context Hub 给智能体喂最新文档。命令示例:chub search openai 返回包列表,chub get openai/chat 拉取知道 GPT 5.5、responses API 的最新实现(生成约 600 行上下文,主要是给智能体读的)。

    Code Dream——当天首发预览版,帮助"人的技能发展":

    • 不是课程,而是一场对话:和"AI 版吴恩达"边聊边用现代方式(配合 Context Hub)写代码,随时能用麦克风打断提问,由名为 Yavira 的语音智能体协助答疑。
    • 现场演示(吐槽会场 Wi-Fi 差):讲义本身是可交互 JavaScript,能点、能打字(“讲个烂网络的笑话”)、能从幻灯片复制命令粘到浏览器里的终端,跑 npm install chub、启动 open code 写 Python——一个练习现代 AI 编码的沙盒环境。

    4 · AI Prompting for Everyone(完整入门课)

    23:38 – 2:52:17 · 全片最大篇幅,面向所有人的实用 prompt 课

    目标:把你从现在的水平带到 “AI 高手(power user)”。以下按课程小节逐个展开。

    4.1 新手 vs 高手

    • 新手把 AI 当 Google 用,只问简单问题。(例:问"Taco Bell 还有双层塔可吗?"得到个答案就完事。)
    • 高手问难问题并给它时间思考。(买车例:上传车规、报价、保险方案等一堆文档,让它"读完所有资料、认真想清楚再回答各车利弊",AI 会花几十秒甚至几分钟出一份详细报告。)
    • 给足上下文:把 AI 想象成"很聪明但还不了解你的应届毕业生"。短 prompt 常让它填空式瞎猜。(自我评估例:别只说"帮我写份给老板的自评";上传项目追踪器截图、近期项目文档、语音备忘,它才能写出真正贴合你的内容。高手对 AI 几乎有种"共情"——设身处地想它到底够不够信息把活干好。)
    • 写作方式不同:新手让 AI 直接"写篇黑莓手机博客"→ 一堆"AI slop";高手让它先出大纲、再批判大纲、迭代几轮,最后才成文。
    • AI 犯错其实比人们以为的少(2022/23 年错得多)。少数病毒式翻车(“strawberry 有几个 r”、“我要洗车,该走路还是开车过去?→ 走路”)并不代表真实能力。

    4.2 AI 的知识从哪来(预训练)

    • AI 像孩子学写作一样,从海量互联网文本里学模式。理解它读了什么,就能预测它何时靠谱。
    • 它甚至懂冷门知识。(例:NASA 的 Voyager 1(1970 年代发射、现距地球约 250 亿英里)金唱片上刻了什么——AI 能答出用 55 种语言问候。)
    • 预训练知识反映数据频率:烹饪、名人、电影文本极多;类星体(quasar)这种专业话题少得多;粤语(8000 万+ 使用者)在网上占比可能不到 0.1%;你公司的私有数据它则完全不知道。→ 想想"某类信息在网上有多常见",就能大致判断答案可靠度。
    • 它能读懂拼错的文字(“can you cook eggs in microwave” 打飞快也能懂),因为训练数据里就有大量 typo。所以你打字有错别字不用纠结。
    • 坏消息:网上也有很多误解和过时信息,需要靠 prompt 技巧去规避。

    4.3 联网搜索(Web Search)

    • 模型有知识截止日期,之后的事不知道。(例:问"2025 年的 6-7 meme 是什么"会触发联网;OpenAI GPT 5.4 截止日期是 2025 年 8 月,该 meme 之后才爆火,故模型本身不知道。)
    • 哪些问题倾向触发搜索:位置相关(“帮我找 Mountain View 附近高评分健身房”)、时效相关、冷门信息(Cooper’s Hill 滚奶酪比赛)。
    • 触发方式:模型自动决定,或你手动(点按钮 / 直接写"请联网搜索")。多数主流模型有此能力,但并非全部。
    • 局限:也可能拉到差的来源。

    4.4 可靠来源 & 搜索的底层原理

    • 引导来源:(灰市肽(补剂)例:不加引导,AI 可能采信 Reddit/Quora 或卖肽的网站(有立场);若要求它用官方机构(WHO、美国 FDA、欧洲 EMA)或严谨科学研究,答案更可信。)
    • AI 最常引用的网站排序(某报告):Reddit > 维基百科 > YouTube > Google > Yelp……可靠度参差。高可信的科学来源在网上文本量本就少,不引导它就会拉"最易得"而非"最可靠"的。
    • 网页可能过时。(例:帮他找 Henderson, Nevada 跑步地点,结果引用了 20 多年前的网页,推荐了一所早已不对外开放的学校。)

    [!example] 搜索底层原理(重要,能解释很多翻车)
    把它想成两人客服团队:面向用户的主模型 + 负责搜索的副模型。你发问 → 主模型让副模型去搜 → 副模型用搜索引擎搜、过滤、下载最相关网页、做摘要 → 把摘要交回主模型 → 主模型据此作答。

    关键 quirk:主模型其实没读过它引用网页的全文,只看了摘要,因此有时会误读、误引——你会看到"AI 说某网页支持某结论,但你点开发现根本没有"。(Machu Picchu 例:副模型搜"许可证/天气/风俗"再摘要回传。)

    什么时候用 AI、什么时候用搜索引擎:想快速扫多个来源、导航到某个具体网站、看原始数据(如买 2013 本田思域空滤,要落地到购买页)→ 用搜索引擎;想要多源综合、权衡利弊、得出更深思熟虑的结论 → 用 AI。

    4.5 Deep Research(深度研究)

    让 AI 综合几十个来源、大量思考,产出深度研究报告。ChatGPT、Gemini、Claude 都有此模式,他认为被严重低估。

    • (万圣节鬼屋例:给它场地大小、想要的体验等上下文 → 它先出研究计划(你可批准/编辑)→ 依次搜"Palo Alto 许可规定、消防安全指南、装饰创意" → 边读边综合 → 最后写详细分节报告。这本身就是 agentic AI 的例子(自主决定下一步搜什么)。)
    • Gemini 的 Deep Research 还能一键把结果变成网页/信息图(预算饼图、噪音条例可视化、可勾选的清单)。
    • 原理:制定计划后并行发起多个搜索、同时取回多网页、评估相关性、决定是否换关键词再搜,循环几轮后汇总加引用成报告。
    方式来源量耗时适合
    预训练知识 0 秒级 常识、定义、摘要
    Web 搜索 少量 数秒 时效/位置/单点问题
    Deep Research 几十+ 数分钟~更久 需综合多源的复杂问题

    4.6 把 AI 当思考伙伴 / 头脑风暴

    • 据 OpenAI 对 ChatGPT 对话的分析:约一半是写作和实用指导;创意构思占 3.9%(近 4%)。
    • AI 擅长生成大量选项(经典创造力测试:给一块砖想出 200 种用途)——你的角色是评估挑选。
    • (健身例:“帮我做健身计划,38 岁、初级、10 磅哑铃、每天 15 分钟"→ 得到通用答案(深蹲、俯卧撑)。若加怪上下文"我有蹦床和一只猫、坚持不下来"→ 得到"蹦床间歇”"猫触发式微运动"等更有创意的方案。)
    • 为什么默认给平庸答案:横轴放"回答的独特性"、纵轴放"AI 给出该回答的概率"——常识答案概率远高于奇招,因为网上写哑铃弯举的文本远多于"猫触发微运动"。给更多上下文能把它推向更相关、更有创意的空间。
    • 迭代法:(还债例:信用卡 $1,100@19%、月最低还款 $40、学生贷 8%、家庭借款 $900 → 让它给 3~5 个方案(保流动性 / 先还最高息 / 先还家人)→ 你反馈"不喜欢方案一太被动,喜欢先还 19% 的;对了我还有 $450 现金要到、要搬回家住"→ 它据此再出三个新方案。反复几轮直到满意。)

    [!tip] 头脑风暴配方
    ① 尽量先给足相关上下文 → ② 让它给一把选项(3~5 个)→ ③ 对选项给反馈 → ④ 让它再给一批 → 重复几轮,直到有一两个你满意的点子,再让它把它展开细化。

    4.7 上下文(Context)如何工作

    • 人的工作记忆约 7 项(记 7 样购物清单勉强够,15~20 样就难);AI 能吃巨量上下文,有些模型达数十万词。
    • (选公寓例:上传上百页租约合同 + 租客评价 + 社区统计,让它"读完所有资料、认真想清楚再答"每套的利弊。)
    • Context = 模型用来生成本次定制回答的所有文本和文件。同一个问题(物理 vs 动物学的利弊),给了你的职业测评结果 + 高中课表后,答案会定制得多、质量高得多。判断该给什么上下文:想"一个可信顾问要给你好建议,需要知道哪些信息"。
    • 顶尖模型可接受约 75 万词上下文 ≈ 前 4~5 本《哈利·波特》≈ 好几天不间断的说话量。很多人严重低估了能喂多少。
    • 默认上下文里有什么:系统提示(当前日期、模型名、能力、通用指令)、工具说明(如"什么是网页搜索、怎么用")、你的 prompt,以及不断累加的聊天历史。

    [!warning] 管理上下文
    要转去不相关的新话题时,开新对话清空上下文。(例:刚让它按"你的日程和偏好"排了健身计划,紧接着说"给我妈也排一个"——旧上下文(你的日程/偏好)会干扰、可能拉低答案质量,还难判断是否被带偏。)

    4.8 AI 桌面 App(Cowork 类)

    • 如 Claude Cowork、Microsoft Copilot、Google Antigravity:在你授权下,能自主(agentically)从你电脑读文件补齐所需上下文来干活。
    • (整理文件夹例:一个塞满 PDF、图片的乱文件夹,让它读一遍并提出新组织方式(重命名、移动、建子目录)。流程:让它先出计划、别动手 → 你审阅/批评/让它改 → 满意后再执行。)
    • (排片场表例:在"filming 文件夹"里启动,说"排本周拍摄计划",它自己探索文件、加载相关的,甚至注意到某位组员 Mia 生日在拍摄周、帮你安排庆祝。)

    [!warning] ⚠ 安全提醒
    桌面 App 能读、能改、甚至删你的文件(虽罕见但确有发生)。① 在最相关的文件夹里运行,别在 home 目录给它全盘访问;② 认真看每次权限请求;③ 它删的文件常不进回收站、可能无法恢复;④ 它改过的文件通常没有编辑历史,无法回退。不熟前务必逐条看权限。

    4.9 推理 / 让它"想久一点"

    • 最新模型推理能力很强——给对上下文,能长时间严谨地思考。他越来越把 AI 当"推理引擎"用(如前述买车利弊)。
    • 引用 METR 研究:横轴"人类完成该任务需多久"、纵轴 AI 成功率。2024–25 年 AI 能做需数秒~数十分钟的任务;2025 年起,能以不错成功率完成人类要花很多小时的任务(且 AI 不一定要花同样久)。
    • “think step by step” 已过时,他不再这么说;现在直接说 “think hard”,模型就懂要长篇、更复杂地推理。有人用关键词 “ultrathink” 触发更深思考,可能想几十秒到十几分钟。
    • 鼓励给难任务试水(如"给一个 4 人、现金有限的创业公司设计上市计划"),并给足"任何人做这活都需要"的上下文。

    [!tip] 推理任务小结
    ① 用能拿到的最好模型(通常胜过半年~一年前的旧模型);② 给足所需上下文;③ 别只喂琐碎任务,敢给难题;④ 选"思考模式"或直接在 prompt 里让它 think hard。

    4.10 谄媚(Sycophancy)

    AI 因训练方式而强烈倾向说你爱听的话。这是关键 prompt 技能:中立提问 + 保持上下文客观。

    • (带偏见的问法:"你不觉得远程办公比坐班好吗?"→ 多半附和;反过来"坐班是不是更高效?"→ 也会附和。问法暗示了你想要的答案,它就顺着强化你的偏见。)
    • 《华盛顿邮报》研究:ChatGPT 更爱说"没错/好观点/你思路对",比说"不太对/并非如此/实际上"多约 10 倍;有的还会说"哥们,你说得太深刻了,一千个赞"。
    • 成因:用人类反馈训练成"讨喜助手"→ 附和更易得👍(内向/外向例:肯定式回答更易被点赞,中立回答反而被踩),于是学会更爱附和。谄媚"感觉良好但降低答案质量"。
    • 更难察觉的谄媚:“分析这些数据,找出本季度所有正面的业绩指标”——你已在暗示要报喜,它就更可能只说"营收增长、利润率改善"而不点问题。

    [!tip] 中立措辞对照

    • ❌"碳税是不是对小企业不好?" → ✅"碳税**在多大程度上(如果有的话)**影响小企业?"
    • ❌"你同意 AI 会创造很多岗位吗?" → ✅"目前的研究怎么说 AI 对就业的影响?"
    • ❌"远程办公会降低生产力吗?" → ✅"远程与坐班的生产力相比如何?"
    • 技巧:并列两个选项让它列各自利弊,但不暗示你希望哪个赢;或给它**评分标准(rubric)**逼它客观。

    4.11 写作

    • OpenAI 数据:写作占 ChatGPT 任务的 24%,是最大单一类别。“写作其实是一种思考”。
    • 什么是 AI slop:直接让 AI 写 → 读着"像 AI 写的"、每句单看还行但整体空洞。特征:**破折号(em-dash)用得远超常人(Bluesky 上自 ChatGPT 后一路走高);过度使用 “nuanced”、“delve”;爱用"三项列举";爱用"not X but Y"**句式(X、Y 都很虚)。一项调查:近 40% 美国上班族上月收到过"work slop"。
    • 有趣:人类因大量用 AI,说话也开始像 AI——ChatGPT 后播客/演讲里 “delve” 变多(即兴和备稿都如此)。
    • 渐进式大纲法(避免 slop):不让它直接成文,而是先写大纲 → 精修 → 迭代几轮 → 再生成正文。(例:写"小 AI 团队比不用 AI 的大团队更快"的文章:先让它搜正反证据 → 给 3 个大纲选项(含反方章节)→ 你反馈"用选项一、保留三个故事、去掉故事一后的论点、加个历史类比:90 年代皮克斯用小团队做出第一部全 CG 长片《玩具总动员》"→ 得修订大纲。)
    • 为什么先写大纲高效:直接改成文只改一个词、整段不变;改大纲一处就能带动整段/整节重写——杠杆率高得多("会飞的松鼠能不能扛椰子"示例)。

    4.12 编辑 & 用 rubric 评分

    • OpenAI 数据:写作类对话约 2/3 是从"已有文本"出发,而非白纸。
    • 逐段编辑:一次改一句/一段,围绕每段小小头脑风暴、定稿再下一段,比一次全改后再从长文里找改了啥要好管理得多。(例:“公众以为实现 AGI 意味着电脑会像人一样小”——让它给出"有力版/有远见版/口语版"几种改写,挑你喜欢的。)
    • 整体评价用 rubric(评分标准):直接让它评一篇科幻小说,因谄媚多半夸你写得好。给明确评分标准逼它客观。(科幻 rubric 例:人物 25 分、情节 25 分、世界观、文笔……并细化每条如何打分(“每个有名字的角色是否都有目标 = 10 分”)。每条标准都非真即假、无中间地带,强制客观。不确定用什么标准?让 AI 帮你先拟一份。)
    • 用法:把 rubric + 文本一起给它,让它逐条打分、最后加总,再让它给"如何在这些维度上改进"的建议。
    • 写得差的 rubric 会诱发谄媚:如"给我这科幻打个 100 分制分数"——它会先跳到一个总分再倒推分类,且"人物/情节"等定义模糊。实测:主观 rubric 打 83,客观 rubric 打 75,且改进建议更有用。
    • 跨模型互评:让 Gemini 用 rubric 评 ChatGPT 的作品(或反之),融合两模型知识,效果略好。但他自己很少用;更常做的是频繁切换不同模型。
    • 锯齿智能(jagged intelligence):AI 有些任务超过任何人(快速读海量网页、解难题数学),有些又不如人;且不同模型"锯齿"方向不同、市场竞争激烈、最优模型频繁变。→ 常拿同一 prompt 喂多个模型对比,保持手感。

    4.13 多模态(图/视频/语音/代码)

    • AI 能生成图像、视频、语音、音乐、代码。(蛋糕例:为女儿 Nova 七岁生日,用 Google 的 Nano Banana 生成猫主题蛋糕设计图 → 拿给蛋糕师做成真 3D 蛋糕。图像生成成了"头脑风暴工具"。)
    • 还演示了:AI 生成"男人缩小"的视频(过去要昂贵特效);用他的语音克隆念 The Batch 通讯(放给父母听,一位听得出、一位听不出);给女儿用 AI 生成"打对字母就喂猫"的打字小游戏。
    • 输入输出可任意组合(上传灵感图 → 规划万圣节服装;上传诡异音效 → 生成鬼屋视频)。
    • 生成成本/耗时:文本最低 < 语音 < 图像 << 视频。越靠右越慢越贵。2022 年 Google Imagen 有瑕疵(水槽线条不对、盘子中途变样),现代模型好很多、还能自动配音同步。

    [!warning] 责任
    语音生成能修播客口误、给游戏角色配音,但也冲击配音演员生计,并被用于语音克隆诈骗(假冒亲属称紧急要转账)。有益用途远多于有害,但仍需防范。

    4.14 把图像作为输入

    • (白板例:上传他在白板前讲课的照片问"这堂课讲什么"——尽管他的头挡住了 “convolutional” 一词,AI 仍答出在讲卷积神经网络(CNN),还能猜下一步会让学生做什么。)
    • 弱点:AI 看图偏"粗看",易漏细节。(问"我健身房这些是什么器械"常自信答错(模糊看很多器械长得像);但换成视觉上很独特的"人形仓鼠轮跑步机"就答得好。)
    • 能读图上文字:拆账单(“我点了这些,我该付多少”)、读手写体(转写、建家族史档案)。但会出错,高风险场景别全信,愿意花几秒复核就还行。
    • 可一次上传多张图(头脑风暴的便签、白板照 + 笔记 → 让它总结今天会议的点子)。一图胜千言,加图常是给 AI 上下文最快的方式。

    4.15 图像生成

    • 以图改图:(例:一张褪色的童年老照片,让它"去反光、去粗糙纹理、改成更自然的比例"→ 修复得很好(用 Nano Banana)。)
    • 不会写图像 prompt?先让文本 AI 帮你写(“给’一只猫深夜偷偷经营咖啡馆’生成一段图像 prompt”——它会指定场景、角色细节、氛围/风格)。
    • 图像的语言:cinematic(电影感)、watercolor(水彩)、cyberpunk、anime……懂艺术/艺术史的人更会 prompt。想精进可上传图片问 AI"你会怎么描述这张图"来学词汇。
    • 扩散模型原理:文本是逐字生成;图像是一次性整张生成。训练时看"带描述的图"(如"木桌上的小盆栽"),学会从纯噪声逐步"去噪"到清晰图。你给 prompt 时它就从噪声出发去噪成图。
    • 典型错误:手/手指数目怪异、文字乱码(“happy birthday” 拼错)、角色跨帧不一致。现代模型(如 Nano Banana)已改善很多,能出文字基本可读的信息图、跨帧一致的卡通角色。
    • 图像生成慢且贵(单张几十秒、几美分,且不能中途停),所以迭代受限;视频更甚。好消息:生成任何东西的成本都在逐年下降。

    4.16 造应用(初探)

    • 不写代码也能做小游戏/网站。(例:prompt"做个用户放置障碍和目标的游戏"→ Claude 生成可玩的小游戏;"烟花展示"prompt → 生成可点击放烟花的 app。)
    • 写 app prompt 的积木:① 目标(要做什么)② 输入(用户要提供什么)③ 输出(app 给用户看什么)。
    • 还能做实用小工具:番茄钟(25 分工作 + 5 分休息)、分账计算器、看天气选穿搭 app。这些任务单一、不需额外文件,适合新手起步。
    • 难易差别:平台跳跃小游戏、法语单词测验 = 较易;联网多人游戏、带 AI 反馈的实时法语练习 = 较难。不确定就试,最坏就是不成,顺便练直觉。(并推荐进阶课 “Build with AI”。)

    4.17 数据分析(让 AI 写代码分析)

    • 把健康/运动数据、公司销售等表格丢给 AI,它能写代码分析并出图,你无需写代码。运行代码是 AI 的一种"工具",在有数据/需计算/需画图时会被调用。
    • (奶茶店例:附上销售数据,prompt"哪些饮品销量变化最大?画出来"→ AI 走 agentic 流程:查看数据 → 算月度变化 → 识别最有意思的几款 → 出彩色折线图(草莓抹茶春季起飞、芒果绿茶/草莓柠檬夏季、椰奶茶秋季)。)
    • (年终图例:“给奶茶店做一页年终回顾图,仔细分析数据找洞见”——"carefully"会触发它想几分钟、写代码算营收/销量,产出带洞见(黑糖和经典最畅销)和奶茶配色的图。)
    • 数字可能幻觉,建议复核;但因是写代码算出来的,通常相当准,且比自己在 Excel/Sheets 里快得多。

    [!example] 本部分练习 & 期末项目
    练习 lab 内置四个 prompt:烟花秀、配色板选择器、法语抽认卡、法语练习。期末项目三步走:① 头脑风暴一个研究问题(如职业选择)→ ② 让 AI 做研究出带引用的报告 → ③ 基于报告造个 app(测验 / 小游戏 / 信息图,可分享给朋友)。


    5 · 用 AI 造应用(“30 分钟做出一个应用”)

    2:52:17 – 3:18:14 · vibe coding,零基础也能上手

    吴恩达开场:“不管你什么背景,都能用 AI 造有用的软件。就算你从没写过一行代码。”

    🎂 生日贺卡 App 演示

    [!example] 演示
    一个跑在浏览器里的网页应用:填姓名、年龄、爱好(企鹅时装设计)、形容词(可疑地有趣)、复数名词(幸运袜)→ 点"生成卡片"→ 出一段搞笑祝福(“Karen,居然满 27 了……”)。还有"手气不错(I’m feeling lucky)"自动填空、把祝福复制到剪贴板、以及保存历史卡片。

    建议先照着把这个 app 亲手做一遍:能培养"怎么跟 AI 说话才拿到想要的结果"的直觉,体会小改动如何带来大不同。

    核心方法:prompting

    • AI 时代造软件最简单的方式不再是手敲代码,而是告诉 AI 去做(= prompting)。可用 ChatGPT / Gemini / Claude 或网站内置的 AI。
    • 增量式:先"做个帮我写生日卡的网页,输入姓名/年龄/爱好,返回搞笑消息"→ 再"加个节日标题和颜色让它更好看"→ 再"把卡片显示在右边、做成打开生日卡的样子"→ 继续加功能。这就是他的真实工作方式:先给基础指令看效果,再反复告诉它怎么改进。

    [!tip] Prompt 的五个积木

  • 目标(Goal)——要造什么
  • 输入(Input)——用户要告诉软件什么
  • 输出(Output)——软件要返回/展示什么
  • 布局(Layout)——左边放什么、右边放什么
  • 特殊功能/指令(Special features)
  • 可以增量一次给一块,也可以把五块写进一个较长的 prompt 一次给。不必每次都用全,顺序也不重要,通常先说目标。

    [!tip] 越具体 → 越可预测(食物卡车类比)
    “给我个三明治” vs “素食三明治” vs “加鹰嘴豆泥、奶酪、全麦面包的素食三明治,再配杯饮料、打包带走”——越具体,拿到的越接近你要的。同一个具体 prompt 多次运行仍会有些差异,这是 AI 的正常现象;不喜欢就再给指令微调。

    动手:下载 & 运行

    • 复制第一个 prompt 发给 AI → 它生成 HTML 页面(生成中"下载"按钮是灰的)→ 生成完点下载 → 在浏览器打开 file.html(他用 Mac 上的 Chrome 演示)。这段代码此刻就跑在你自己电脑上。
    • 想改进就继续 prompt"加节日标题和颜色"→ 等它重写 → 再下载打开,就更喜庆了。
    • 同样的 prompt 在 ChatGPT / Gemini / Claude 上效果类似——学的技能不绑定任何平台。
    • 找反馈:他写完常给朋友、家人甚至礼貌地问陌生人看,或发同事/论坛。别人常有改进点子,逗笑朋友也让他有动力继续。

    加功能 & 修 bug

    • (加功能要具体:不说"加五个字段",而说"做成五个清晰标注的输入:姓名、年龄、爱好、形容词、复数名词";“加个手气不错按钮,用有趣的预设词随机填空”;改主题色蓝→紫、粉、绿随你。)
    • (修 bug:生成的 HTML 有时不工作(点"生成卡片"没反应)。直接告诉 AI"点生成卡片没反应,能修一下吗",它通常能找到并修基础 bug。它可能吐一堆技术解释(“JavaScript 绑定到按钮 click 事件……”)——现在不用懂,直接下新 HTML 看是否好用即可。)

    🏓 乒乓球游戏

    [!example] 演示
    电脑史上最早的游戏之一 Pong 当年团队要做几周,现在几分钟。prompt:"做个单 HTML 文件的桌球游戏,人机对战,方向键控制球拍"→ 首版 → 再"加三个难度、让用户设定获胜分数、并计分"→ 再"球场绿色、球拍米色、球白色,插入这张背景图"→ 成型可玩。要点仍是:写得越具体,结果越好。

    期末项目 & 收尾

    • 期末项目:做一个自己的"填空故事生成器",须含 3~5 个输入字段、一个按钮、一个显示输出的地方(灵感:搞笑产品评价生成器、请假条生成器等)。做好上传 HTML,AI 会检查是否正常并给反馈 → 拿结课证书。
    • “既要造,也要上课”:只造不学易反复造轮子、或用很奇怪的方式做事;只学不造则只有理论。两者都重要,持续构建、持续学习。
    • 致谢 DeepLearning.AI 的 Summer Ray、Andres Gonzalez、Tommy Nelson。

    ★ 核心要点速记

  • Evals 是护城河:无论 agentic 系统还是日常用 AI,"有纪律的错误分析 + 评估"是最被低估、却最能拉开差距的能力。
  • 给足上下文:把 AI 当"聪明但不了解你的应届生",短 prompt = 平庸答案;顶尖模型能吃约 75 万词。
  • 警惕谄媚:用中立措辞、给客观 rubric,别在提问里暗示你想要的答案。
  • 写作先写大纲:直接成文出 AI slop;先大纲→迭代→再成文,改大纲杠杆率最高。
  • 三档信息获取:预训练知识(秒)/ Web 搜索(数秒少量源)/ Deep Research(分钟级几十源)——按问题复杂度选。
  • 造应用五积木:目标 / 输入 / 输出 / 布局 / 特殊功能;越具体越可预测;遇 bug 直接让 AI 修。
  • 工程趋势:趋向近 100% AI 编码 → 瓶颈转到"做什么"和设计/法务/市场 → 小而全通才团队 → 不看好失业潮,AI 工程师严重稀缺。
  • 持续换模型:AI 是"锯齿智能",最优模型频繁变,常拿同一 prompt 对比多个模型保持手感。

  • 赞(0)
    未经允许不得转载:171主机测评 » 吴恩达:从 Agentic AI 到“人人都能用 AI 造应用
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址