第2章 AI基础知识简介
本章摘要: 本章用通俗比喻为零基础读者建立 AI 全景认知:AI 是“让机器感知、理解、思考、创造”的技术总称,与传统软件的根本区别在于从“规则驱动”转向“数据驱动”。核心内容涵盖机器学习、深度学习、大语言模型、推理模型、多模态、计算机视觉、语音识别与合成、智能体等 8 类技术,并解释 Prompt、幻觉、API、上下文窗口等 8 个高频术语。同时客观指出 AI 的能力边界——擅长文字处理、分析与创作,但无法保证 100% 事实正确、不能替人承担重大责任决策。文末通过“AI 与传统搜索对比”“多模态图文理解”两个实操示例和术语连连看练习,帮助读者巩固理解。
本章目标:用最通俗的语言,帮零基础读者建立对人工智能(AI)的全景认知——它到底是什么、和传统软件有啥不同、背后有哪些核心技术、常用术语怎么理解,以及它现在还做不到什么。读完这一章,你再打开任何一款 AI 工具都不会“发懵”了。
学习目标
学完本章,你应该能够:
- 用自己的话解释什么是人工智能(AI),并说清它和“传统软件”的根本区别。
- 认识本章涉及的 7 类核心技术:机器学习 / 深度学习 / 大语言模型 / 多模态 / 计算机视觉 / 语音 / 智能体。
- 理解 8 个高频术语:Prompt(提示词)、生成式 AI、多模态、推理模型、幻觉、API、智能体、上下文窗口。
- 客观看待 AI 的能力边界:知道它擅长什么、不擅长什么,学会“人机协作”的正确姿势。
正文讲解
2.1 AI 发展简史
AI 并非近几年才出现的新事物,它的历史可以追溯到 20 世纪中叶。1950 年,图灵提出“机器能否思考”的著名测试,为 AI 奠定了思想基础;1956 年达特茅斯会议正式提出“人工智能”一词,标志着该学科的诞生。此后 AI 几经起伏,直到 2012 年深度学习在图像识别上取得突破,才迎来爆发;2017 年 Transformer 架构问世,直接催生了今天的大语言模型(LLM)。2022 年底 ChatGPT 发布,让 AI 真正走进大众生活。
| 1950 | 图灵测试提出 | 首次给出“机器能否思考”的判断标准 |
| 1956 | 达特茅斯会议 | “人工智能”学科正式诞生 |
| 1997 | 深蓝战胜国际象棋冠军 | AI 在特定领域超越人类 |
| 2012 | 深度学习崛起 | 图像识别准确率大幅跃升,AI 迎来爆发 |
| 2017 | Transformer 架构问世 | 为大语言模型奠定技术基础 |
| 2022 | ChatGPT 发布 | AI 走进大众,开启生成式 AI 时代 |
2.2 什么是人工智能(AI)
人工智能(Artificial Intelligence,简称 AI),简单说就是“让机器像人一样去感知、理解、思考和创造”的技术。它不是一个具体的软件,而是一整套方法的总称——就像“交通工具”包含了汽车、飞机、轮船一样,AI 也是一个“大家族”。 我们可以用一个比喻来理解:
- 传统软件像一台“自动售货机”——你按按钮(输入确定指令),它吐出固定商品(输出提前写死的结果)。售货机永远只会做设计好的那几件事。
- AI则像一个“训练有素的助手”——你告诉它目标,它会根据经验灵活应对,甚至能处理从没见过的状况。AI 与传统软件的核心区别:从“规则驱动”到“数据驱动”。
| 工作原理 | 程序员把“如果 A 就做 B”的规则一条条写死 | 让模型从海量数据里自己学出规律 |
| 面对新情况 | 没写规则就无能为力 | 能根据学到的模式“举一反三” |
| 典型例子 | 计算器、Excel 公式、红绿灯定时控制 | 语音助手、人脸识别、ChatGPT 写作 |
| 谁在“做决定” | 规则(人写的) | 模型参数(机器从数据中学的) |
一句话总结:传统软件是“人把答案写进代码”,AI 是“人给数据,机器自己找答案”。
2.3 核心技术速览
下面用比喻逐个讲清本章涉及的几大核心技术。
1. 机器学习(Machine Learning,ML)——会“总结经验”的算法 比喻:像你通过反复练习学会了区分猫和狗,机器学习也是给计算机看成千上万张猫狗照片,让它自己总结出“猫有尖耳朵、狗鼻子更长”这类规律。它不需要人把规则写死,而是从数据里学规则。 2. 深度学习(Deep Learning,DL)——模仿大脑的“多层神经网络” 比喻:机器学习有时像“浅尝辄止”,而深度学习像叠了很多层的过滤网(神经网络),每一层提取更抽象的特征——第一层看边缘,第二层看形状,第三层看“这是一只猫”。今天几乎所有厉害的 AI(包括 ChatGPT)都建立在深度学习之上。 3. 大语言模型(Large Language Model,LLM)——读过海量书的通才 比喻:把大语言模型想象成一个“从小读完了互联网上几乎全部书籍、文章、对话的通才”。它把人类的语言规律“背”进了上亿甚至上万亿个参数里,所以你问它什么,它都能用流畅的自然语言接上话。ChatGPT、DeepSeek、豆包、文心一言背后都是大语言模型。
4. 推理模型(Reasoning Model)——先“想清楚”再回答的模型 比喻:普通模型像“脱口而出”的学生,推理模型像“先在草稿纸上一步步推导”的优等生。遇到数学题、逻辑题、复杂规划时,它会先内部推理(Chain-of-Thought,思维链),再给出更可靠的答案。代表:GPT-5 Thinking、Claude Opus 5、DeepSeek-R1。
5. 多模态模型(Multimodal Model)——能“看、听、说”的全能选手 比喻:只会文字的 AI 像个“只读文字的学霸”;多模态 AI 像个“眼耳口鼻都灵光的人”,能同时处理文字、图片、音频、视频。你给它一张图,它能描述内容;你给它一段语音,它能转写并总结。代表:Gemini、GPT-5、豆包。
6. 计算机视觉(Computer Vision,CV)——赋予机器“眼睛” 比喻:计算机视觉就是让机器“看懂”图像和视频的技术,比如识别照片里有没有猫、工厂零件有没有划痕、医院 CT 里有没有异常。它是多模态能力中“看”的那一部分。
7. 语音识别与合成(ASR / TTS)——机器的“耳朵”和“嘴巴”
- ASR(Automatic Speech Recognition,语音识别):把人说的话变成文字,像“耳朵”。比如讯飞听见把会议录音转成字幕。
- TTS(Text To Speech,语音合成):把文字变成人声,像“嘴巴”。比如听书 App 用 AI 念小说。
8. 智能体(Agent)与工具调用(Tool Use)——会“自己干活”的 AI 比喻:普通聊天 AI 是“参谋”(只给建议);智能体是“执行官”——它能自己规划步骤、调用工具(查网页、跑代码、发邮件)、一步步把任务干完。比如你说“帮我订下周去上海的便宜机票并把行程发到邮箱”,智能体会自己拆任务、查航班、填信息。Claude Code、Coze 机器人都属于这类。
2.4 常见术语解释
下面 8 个术语是后续章节的高频词,务必记住。
| Prompt(提示词) | 你发给 AI 的“指令或问题”,相当于你对助手说的第一句话 | “请写一篇关于春天的 200 字短文” |
| 生成式 AI(Generative AI) | 能“无中生有”创造新内容的 AI,而不是只做分类或预测 | ChatGPT 写文章、Midjourney 画图 |
| 多模态(Multimodal) | AI 能同时处理文字、图片、音频、视频等多种信息 | Gemini 看图答题、豆包语音对话 |
| 推理模型(Reasoning Model) | 先内部“一步步思考”再回答的模型,适合难题 | GPT-5 Thinking、Claude Opus 5 |
| 幻觉(Hallucination) | AI 一本正经地编出了虚假或不准确的内容 | 编造一个并不存在的论文引用 |
| API(应用程序接口) | 程序之间“打电话”的接口,开发者用它把 AI 能力嵌进自己的软件 | 开发者用 API 让自家 App 拥有对话功能 |
| Agent(智能体) | 能自主规划、调用工具、完成多步任务的 AI | Claude Code 自动改代码、Coze 机器人 |
| 上下文窗口(Context Window) | 单次对话里 AI 能“记住”的最大文字量(按 token 计) | 2026 主流模型已达百万 token 级 |
小知识:token(词元) 不是“字”也不是“词”,而是模型切割语言的最小单位。中文里大约 1 个 token ≈ 1~2 个汉字;英文里大约 1 个 token ≈ 0.75 个单词。上下文窗口越大,AI 一次能“读”的东西就越多。
2.5 AI 的能力边界
了解生成式 AI 能做什么很重要,了解它做不到什么更重要——这能帮你避开 90% 的坑。
生成式 AI 擅长做什么:
- 写初稿、润色、翻译、总结长文(文字流水线活)。
- 从海量资料里提炼要点、做分类和初步分析。
- 写代码、补注释、找简单 bug。
- 把想法快速变成图片、视频脚本、PPT 大纲。
- 7×24 小时不疲倦地处理重复性脑力劳动。
生成式 AI 目前还不适合 / 做不好的事:
- 保证 100% 事实正确:它会产生“幻觉”,关键信息必须人工核对。
- 替你做重大责任决策:医疗诊断、法律判决、投资下单,AI 只能辅助,不能拍板。
- 理解真实世界的物理后果:它不知道“热水烫手”,也没有真实感受。
- 掌握你没告诉它的私密/实时信息:不知道你公司内网昨天的会议,也不知道此刻的实时股价(除非联网)。
- 具备真正的主观意识与价值观:它是在“模仿”人类表达,并不真正“理解”善恶与情感。 真实翻车案例:
一位实习生让 AI 帮忙写一份合同风险分析报告,AI 一本正经地引用了一部并不存在的《合同法司法解释》条文,还标注了“第 27 条第 3 款”。实习生图省事没有核对原文,直接把报告交给了领导。结果法务复核时发现该条文纯属虚构,报告被当场退回,还差点影响项目签约进度。
避坑检查清单(每次用 AI 前过一遍):
- 关键引用必查原文:法律条文、论文、数据、人名、网址,一律回到权威来源逐字核对,别直接复制粘贴。
- 拿不准就追问:让 AI 给出出处链接或原文截图,并明确说“请标注哪些内容你不确定”,再人工复核一遍。 幻觉识别小练习:
下面 3 段都是 AI 生成的回答,每段都藏了可疑点。请先圈出你觉得不对劲的地方,再说说你会怎么核实,最后对照文末参考答案。
第 1 段(含虚构法律条文):
根据《中华人民共和国数据安全法》第 88 条规定,个人在公共网络发布 AI 生成内容前,必须提前 15 个工作日向属地网信部门备案,否则将被处以 5 万元以上罚款。
第 2 段(含编造的数据来源):
据《2025 中国人工智能应用白皮书》统计,国内有 73.6% 的中小企业已全面部署生成式 AI,其中制造业渗透率最高,达到 91.2%。
第 3 段(含过时信息):
目前最先进的手机芯片是 2021 年发布的骁龙 888,它仍是绝大多数旗舰手机的标配,建议你优先考虑搭载该芯片的机型。
参考答案与核实方法:
- 第 1 段:可疑点是“第 88 条”“提前 15 个工作日备案”“5 万元以上罚款”——这些具体数字和条款号很可能是编造的。核实方法:去「国家法律法规数据库」或政府官网搜索《数据安全法》原文,逐条核对是否存在该条款及对应罚则。
- 第 2 段:可疑点是“73.6%”“91.2%”这类精确到小数点的数据,以及《2025 中国人工智能应用白皮书》这个出处。核实方法:用搜索引擎搜白皮书名称,看是否真实存在、发布机构是谁;找不到原文或机构对不上,就当作不可信数据,别引用。
- 第 3 段:可疑点是“骁龙 888 仍是主流标配”——这是明显过时的信息。核实方法:搜索“2026 年主流手机芯片”或直接查当前在售旗舰机型参数,用最新信息替换后再参考。
通用口诀:凡涉及条款、数据、人名、版本号,先问“出处在哪”,再回权威来源核对一遍,最后才放心用。
人机协作的正确姿势(记住这 4 条):
操作示例
2.6 示例 1:同一个问题,AI 与传统搜索的回答有什么不同?输入问题:“我家客厅朝北、只有 3 平米,想养点好活还能净化空气的植物,推荐什么?”
传统搜索引擎式回答(类似百度/谷歌的搜索结果列表):
搜索结果:
AI 式回答(类似豆包 / DeepSeek / ChatGPT):
根据你的条件(朝北 = 光照少、3 平米 = 空间小、要“好活 + 净化空气”),推荐三种:
差异总结: 搜索是“给你一堆线索,自己找答案”;AI 是“结合你的具体情况,直接给你定制结论,还能接着聊”。
2.7 示例 2:用 Prompt 体验“多模态”能力(图文理解)操作步骤: 打开支持图片输入的 AI(如豆包、Gemini、ChatGPT、通义千问),点击输入框旁的“回形针/+”按钮上传一张图片(比如一张产品照片、一张旅游风景图、一张孩子画的画),然后输入下面的 Prompt:
输入 Prompt:
请描述这张图片,并总结 3 个要点。如果图里有文字,请一并提取出来。
预期输出(以“一张咖啡馆照片”为例):
描述: 这是一张室内咖啡馆的照片。木色吧台后方站着一位咖啡师,正在使用意式咖啡机;左侧靠窗有一张两人小桌,桌上有拿铁和笔记本电脑;整体光线温暖,墙面是复古砖墙。 3 个要点:
说明:这就是多模态——AI 同时“看”图又“读”字又“写”文字。你换成“请翻译图中外文”“给这张图配一句朋友圈文案”也能直接用。
2.8 练习小环节:术语连连看把左列的术语拖到(或写到)右列最匹配的解释前,检验一下自己学会了没:
| Prompt | A. AI 编造的虚假信息 |
| 幻觉(Hallucination) | B. 你发给 AI 的指令或问题 |
| 生成式 AI | C. 能自主规划、调用工具干完任务的 AI |
| 智能体 | D. 能创造新内容(文章/图片)的 AI |
| 上下文窗口 | E. 单次对话 AI 最多能“记住”的文字量 |
答案:Prompt→B,幻觉→A,生成式 AI→D,智能体→C,上下文窗口→E。全对就是合格啦!
小结回顾
本章要点复述:
- AI 是“让机器感知、理解、思考、创造”的技术总称;与传统软件的根本区别是从规则驱动转向数据驱动。
- 核心技术层层递进:机器学习→深度学习→大语言模型(LLM);在此基础上发展出推理模型、多模态、计算机视觉(CV)、语音(ASR/TTS)与智能体(Agent)。
- 8 个必记术语:Prompt、生成式 AI、多模态、推理模型、幻觉、API、智能体、上下文窗口。
- AI 擅长文字、分析、创作、重复脑力活;不擅长保证事实绝对正确、替你担责决策、理解真实物理世界。
- 正确姿势:把 AI 当实习生、关键事实复核、复杂任务拆分、你始终是责任人。
自测题(合上书本试试能否答出):
自测答案:1. 传统软件由人事先写死规则,AI 由模型从数据中学规律。2. 读过海量书的通才。3. 先在内部一步步思考(思维链)再回答。4. AI 编造虚假/不准确内容;应人工交叉验证、不轻信。5. token;越大一次能处理/记住的内容越多。6. 错。7. 多模态能力。
2.9 本章实践任务光看不练容易忘,下面 3 个动手任务帮你把本章知识真正用起来。每个任务都附了「完成标准」,做完对照一下就知道自己掌握得怎么样。
任务 1:让 AI 讲清「机器学习」与「深度学习」的区别
打开任意一款对话 AI(豆包、DeepSeek、ChatGPT 都行),输入下面这句 Prompt:
请用大白话解释什么是机器学习,并说明它和深度学习有什么区别,最好各举一个生活中的例子。
- 完成标准: AI 的回答能让你用自己的话复述出「机器学习是从数据里学规律、深度学习是其中用多层神经网络学得更深的一种」,并且你能举出至少 1 个例子说明两者的不同。
任务 2:用多模态能力「看图说话 + 提取文字」
找一张生活照片(可以是产品包装、路牌、菜单或风景照),上传给支持图片输入的 AI(如豆包、Gemini、通义千问),并输入:
请描述这张图片的内容,并提取图中所有文字。如果图里有英文,请顺便翻译成中文。
- 完成标准: AI 能准确描述图片主体,并成功提取出图中文字(若图里有英文则给出翻译)。如果描述有明显错误,说明它也有「看走眼」的时候——这正是本章讲的 AI 能力边界。
任务 3:让 AI 结合条件推荐办公室绿植
假设你的办公桌朝北、光照少、空间有限,让 AI 推荐 3 种适合办公室的绿植,并说明理由。Prompt 可以这样写:
我的办公桌朝北、几乎晒不到太阳,桌面空间也不大。请推荐 3 种好养活的办公室绿植,并说明为什么适合我的光照和空间条件。
- 完成标准: AI 的推荐结合了「光照少、空间小」这两个条件,而不是泛泛而谈;每种绿植都给出了「耐阴 / 不占地方」之类的具体理由。如果它推荐的植物需要强光,说明它没真正结合你的条件——你可以追问让它重新推荐。
2.10 主流 AI 工具分类速览了解了 AI 的能力边界后,我们再来看看市面上常见的 AI 工具都分哪些类。下面这张表帮你快速建立“工具全景认知”——以后听到某个产品,就能立刻知道它属于哪一类、能帮你干什么。
| 对话助手 | 豆包、DeepSeek、ChatGPT | 日常问答、写作、翻译、头脑风暴,随叫随到的“全能参谋” |
| AI 绘画 | Midjourney、Stable Diffusion、文心一格 | 输入一句话生成插画、海报、头像,零基础也能做设计 |
| AI 编程 | GitHub Copilot、Claude Code、通义灵码 | 写代码、补注释、找 bug,程序员的高效“结对搭档” |
| AI 视频 | 剪映、可灵、Runway | 文字/图片一键生成短视频,剪辑、配音、字幕全自动 |
| AI 办公 | WPS AI、Notion AI、Gamma | 写周报、做 PPT、整理会议纪要,把重复文书活交给它 |
提示:很多工具是“多面手”——比如豆包既能聊天也能画图,DeepSeek 也能读文档。分类只是为了帮你快速理解,实际使用时大胆混搭即可。 零基础读者选型建议:
- 日常问答:首选豆包——完全免费、中文支持好、手机 App 即开即用,问什么都接得住,是零基础入门的第一款 AI。
- 写文案:首选DeepSeek——免费且中文写作质量高,朋友圈、小红书、公众号初稿都能写得有模有样,还支持读文档。
- 做 PPT:首选WPS AI——如果你本来就用 WPS,无需额外装软件,一句话就能生成大纲和整套幻灯片,操作门槛最低。
- 学编程:首选通义灵码——免费、中文界面友好,装进 VS Code 就能边写边提示,遇到报错直接问它,比翻文档快得多。
- 画图配文:首选文心一格——免费额度够用、中文提示词理解好,输入“一只戴帽子的橘猫”就能出图,适合给文章配插画。
小贴士:以上推荐都优先考虑“免费 + 中文友好 + 上手快”。等你用熟一款,再按「2.9 表格」里的分类去尝试更多工具,就不会眼花缭乱了。
2.10 参考资料与延伸阅读
想深入了解本章提到的概念,下面 5 份权威资料值得收藏。它们分别对应本章的不同知识点,按需查阅即可。
延伸建议:读论文不必逐字啃,先看摘要和结论即可;工具文档则按“想解决什么问题”去搜,效率最高。
下一章我们将走进《第三章:主流 AI 工具分类全景》,帮你搞清楚“市面上的 AI 工具到底有哪些种类、我该用哪一个”。
