欢迎光临
我们一直在努力

人工智能常用工具学习(二)

第2章 AI基础知识简介

本章摘要: 本章用通俗比喻为零基础读者建立 AI 全景认知:AI 是“让机器感知、理解、思考、创造”的技术总称,与传统软件的根本区别在于从“规则驱动”转向“数据驱动”。核心内容涵盖机器学习、深度学习、大语言模型、推理模型、多模态、计算机视觉、语音识别与合成、智能体等 8 类技术,并解释 Prompt、幻觉、API、上下文窗口等 8 个高频术语。同时客观指出 AI 的能力边界——擅长文字处理、分析与创作,但无法保证 100% 事实正确、不能替人承担重大责任决策。文末通过“AI 与传统搜索对比”“多模态图文理解”两个实操示例和术语连连看练习,帮助读者巩固理解。

本章目标:用最通俗的语言,帮零基础读者建立对人工智能(AI)的全景认知——它到底是什么、和传统软件有啥不同、背后有哪些核心技术、常用术语怎么理解,以及它现在还做不到什么。读完这一章,你再打开任何一款 AI 工具都不会“发懵”了。


学习目标

学完本章,你应该能够:

  • 用自己的话解释什么是人工智能(AI),并说清它和“传统软件”的根本区别。
  • 认识本章涉及的 7 类核心技术:机器学习 / 深度学习 / 大语言模型 / 多模态 / 计算机视觉 / 语音 / 智能体。
  • 理解 8 个高频术语:Prompt(提示词)、生成式 AI、多模态、推理模型、幻觉、API、智能体、上下文窗口。
  • 客观看待 AI 的能力边界:知道它擅长什么、不擅长什么,学会“人机协作”的正确姿势。

正文讲解

2.1 AI 发展简史

AI 并非近几年才出现的新事物,它的历史可以追溯到 20 世纪中叶。1950 年,图灵提出“机器能否思考”的著名测试,为 AI 奠定了思想基础;1956 年达特茅斯会议正式提出“人工智能”一词,标志着该学科的诞生。此后 AI 几经起伏,直到 2012 年深度学习在图像识别上取得突破,才迎来爆发;2017 年 Transformer 架构问世,直接催生了今天的大语言模型(LLM)。2022 年底 ChatGPT 发布,让 AI 真正走进大众生活。

时间里程碑意义
1950 图灵测试提出 首次给出“机器能否思考”的判断标准
1956 达特茅斯会议 “人工智能”学科正式诞生
1997 深蓝战胜国际象棋冠军 AI 在特定领域超越人类
2012 深度学习崛起 图像识别准确率大幅跃升,AI 迎来爆发
2017 Transformer 架构问世 为大语言模型奠定技术基础
2022 ChatGPT 发布 AI 走进大众,开启生成式 AI 时代
2.2 什么是人工智能(AI)

人工智能(Artificial Intelligence,简称 AI),简单说就是“让机器像人一样去感知、理解、思考和创造”的技术。它不是一个具体的软件,而是一整套方法的总称——就像“交通工具”包含了汽车、飞机、轮船一样,AI 也是一个“大家族”。 我们可以用一个比喻来理解:

  • 传统软件像一台“自动售货机”——你按按钮(输入确定指令),它吐出固定商品(输出提前写死的结果)。售货机永远只会做设计好的那几件事。
  • AI则像一个“训练有素的助手”——你告诉它目标,它会根据经验灵活应对,甚至能处理从没见过的状况。AI 与传统软件的核心区别:从“规则驱动”到“数据驱动”。
对比维度传统软件人工智能
工作原理 程序员把“如果 A 就做 B”的规则一条条写死 让模型从海量数据里自己学出规律
面对新情况 没写规则就无能为力 能根据学到的模式“举一反三”
典型例子 计算器、Excel 公式、红绿灯定时控制 语音助手、人脸识别、ChatGPT 写作
谁在“做决定” 规则(人写的) 模型参数(机器从数据中学的)

一句话总结:传统软件是“人把答案写进代码”,AI 是“人给数据,机器自己找答案”。


2.3 核心技术速览

下面用比喻逐个讲清本章涉及的几大核心技术。

1. 机器学习(Machine Learning,ML)——会“总结经验”的算法 比喻:像你通过反复练习学会了区分猫和狗,机器学习也是给计算机看成千上万张猫狗照片,让它自己总结出“猫有尖耳朵、狗鼻子更长”这类规律。它不需要人把规则写死,而是从数据里学规则。 2. 深度学习(Deep Learning,DL)——模仿大脑的“多层神经网络” 比喻:机器学习有时像“浅尝辄止”,而深度学习像叠了很多层的过滤网(神经网络),每一层提取更抽象的特征——第一层看边缘,第二层看形状,第三层看“这是一只猫”。今天几乎所有厉害的 AI(包括 ChatGPT)都建立在深度学习之上。 3. 大语言模型(Large Language Model,LLM)——读过海量书的通才 比喻:把大语言模型想象成一个“从小读完了互联网上几乎全部书籍、文章、对话的通才”。它把人类的语言规律“背”进了上亿甚至上万亿个参数里,所以你问它什么,它都能用流畅的自然语言接上话。ChatGPT、DeepSeek、豆包、文心一言背后都是大语言模型。

4. 推理模型(Reasoning Model)——先“想清楚”再回答的模型 比喻:普通模型像“脱口而出”的学生,推理模型像“先在草稿纸上一步步推导”的优等生。遇到数学题、逻辑题、复杂规划时,它会先内部推理(Chain-of-Thought,思维链),再给出更可靠的答案。代表:GPT-5 Thinking、Claude Opus 5、DeepSeek-R1。

5. 多模态模型(Multimodal Model)——能“看、听、说”的全能选手 比喻:只会文字的 AI 像个“只读文字的学霸”;多模态 AI 像个“眼耳口鼻都灵光的人”,能同时处理文字、图片、音频、视频。你给它一张图,它能描述内容;你给它一段语音,它能转写并总结。代表:Gemini、GPT-5、豆包。

6. 计算机视觉(Computer Vision,CV)——赋予机器“眼睛” 比喻:计算机视觉就是让机器“看懂”图像和视频的技术,比如识别照片里有没有猫、工厂零件有没有划痕、医院 CT 里有没有异常。它是多模态能力中“看”的那一部分。

7. 语音识别与合成(ASR / TTS)——机器的“耳朵”和“嘴巴”

  • ASR(Automatic Speech Recognition,语音识别):把人说的话变成文字,像“耳朵”。比如讯飞听见把会议录音转成字幕。
  • TTS(Text To Speech,语音合成):把文字变成人声,像“嘴巴”。比如听书 App 用 AI 念小说。

8. 智能体(Agent)与工具调用(Tool Use)——会“自己干活”的 AI 比喻:普通聊天 AI 是“参谋”(只给建议);智能体是“执行官”——它能自己规划步骤、调用工具(查网页、跑代码、发邮件)、一步步把任务干完。比如你说“帮我订下周去上海的便宜机票并把行程发到邮箱”,智能体会自己拆任务、查航班、填信息。Claude Code、Coze 机器人都属于这类。


2.4 常见术语解释

下面 8 个术语是后续章节的高频词,务必记住。

术语含义(大白话)示例
Prompt(提示词) 你发给 AI 的“指令或问题”,相当于你对助手说的第一句话 “请写一篇关于春天的 200 字短文”
生成式 AI(Generative AI) 能“无中生有”创造新内容的 AI,而不是只做分类或预测 ChatGPT 写文章、Midjourney 画图
多模态(Multimodal) AI 能同时处理文字、图片、音频、视频等多种信息 Gemini 看图答题、豆包语音对话
推理模型(Reasoning Model) 先内部“一步步思考”再回答的模型,适合难题 GPT-5 Thinking、Claude Opus 5
幻觉(Hallucination) AI 一本正经地编出了虚假或不准确的内容 编造一个并不存在的论文引用
API(应用程序接口) 程序之间“打电话”的接口,开发者用它把 AI 能力嵌进自己的软件 开发者用 API 让自家 App 拥有对话功能
Agent(智能体) 能自主规划、调用工具、完成多步任务的 AI Claude Code 自动改代码、Coze 机器人
上下文窗口(Context Window) 单次对话里 AI 能“记住”的最大文字量(按 token 计) 2026 主流模型已达百万 token 级

小知识:token(词元) 不是“字”也不是“词”,而是模型切割语言的最小单位。中文里大约 1 个 token ≈ 1~2 个汉字;英文里大约 1 个 token ≈ 0.75 个单词。上下文窗口越大,AI 一次能“读”的东西就越多。


2.5 AI 的能力边界

了解生成式 AI 能做什么很重要,了解它做不到什么更重要——这能帮你避开 90% 的坑。

生成式 AI 擅长做什么:

  • 写初稿、润色、翻译、总结长文(文字流水线活)。
  • 从海量资料里提炼要点、做分类和初步分析。
  • 写代码、补注释、找简单 bug。
  • 把想法快速变成图片、视频脚本、PPT 大纲。
  • 7×24 小时不疲倦地处理重复性脑力劳动。

生成式 AI 目前还不适合 / 做不好的事:

  • 保证 100% 事实正确:它会产生“幻觉”,关键信息必须人工核对。
  • 替你做重大责任决策:医疗诊断、法律判决、投资下单,AI 只能辅助,不能拍板。
  • 理解真实世界的物理后果:它不知道“热水烫手”,也没有真实感受。
  • 掌握你没告诉它的私密/实时信息:不知道你公司内网昨天的会议,也不知道此刻的实时股价(除非联网)。
  • 具备真正的主观意识与价值观:它是在“模仿”人类表达,并不真正“理解”善恶与情感。 真实翻车案例:

一位实习生让 AI 帮忙写一份合同风险分析报告,AI 一本正经地引用了一部并不存在的《合同法司法解释》条文,还标注了“第 27 条第 3 款”。实习生图省事没有核对原文,直接把报告交给了领导。结果法务复核时发现该条文纯属虚构,报告被当场退回,还差点影响项目签约进度。

避坑检查清单(每次用 AI 前过一遍):

  • 关键引用必查原文:法律条文、论文、数据、人名、网址,一律回到权威来源逐字核对,别直接复制粘贴。
  • 拿不准就追问:让 AI 给出出处链接或原文截图,并明确说“请标注哪些内容你不确定”,再人工复核一遍。 幻觉识别小练习:

下面 3 段都是 AI 生成的回答,每段都藏了可疑点。请先圈出你觉得不对劲的地方,再说说你会怎么核实,最后对照文末参考答案。

第 1 段(含虚构法律条文):

根据《中华人民共和国数据安全法》第 88 条规定,个人在公共网络发布 AI 生成内容前,必须提前 15 个工作日向属地网信部门备案,否则将被处以 5 万元以上罚款。

第 2 段(含编造的数据来源):

据《2025 中国人工智能应用白皮书》统计,国内有 73.6% 的中小企业已全面部署生成式 AI,其中制造业渗透率最高,达到 91.2%。

第 3 段(含过时信息):

目前最先进的手机芯片是 2021 年发布的骁龙 888,它仍是绝大多数旗舰手机的标配,建议你优先考虑搭载该芯片的机型。

参考答案与核实方法:

  • 第 1 段:可疑点是“第 88 条”“提前 15 个工作日备案”“5 万元以上罚款”——这些具体数字和条款号很可能是编造的。核实方法:去「国家法律法规数据库」或政府官网搜索《数据安全法》原文,逐条核对是否存在该条款及对应罚则。
  • 第 2 段:可疑点是“73.6%”“91.2%”这类精确到小数点的数据,以及《2025 中国人工智能应用白皮书》这个出处。核实方法:用搜索引擎搜白皮书名称,看是否真实存在、发布机构是谁;找不到原文或机构对不上,就当作不可信数据,别引用。
  • 第 3 段:可疑点是“骁龙 888 仍是主流标配”——这是明显过时的信息。核实方法:搜索“2026 年主流手机芯片”或直接查当前在售旗舰机型参数,用最新信息替换后再参考。

通用口诀:凡涉及条款、数据、人名、版本号,先问“出处在哪”,再回权威来源核对一遍,最后才放心用。

人机协作的正确姿势(记住这 4 条):

  • 把生成式 AI 当“强力实习生”:交代清楚背景、目标和格式,而不是只丢一句“帮我弄一下”。
  • 关键事实要复核:尤其是引用、数据、人名、法律条款——交叉验证后再用。
  • 复杂任务拆步骤:一次性要它干大事容易翻车,分多轮引导效果更好。
  • 你才是负责人:生成式 AI 出错的代价由使用它的人承担,保持批判性思维。

  • 操作示例

    2.6 示例 1:同一个问题,AI 与传统搜索的回答有什么不同?输入问题:“我家客厅朝北、只有 3 平米,想养点好活还能净化空气的植物,推荐什么?”

    传统搜索引擎式回答(类似百度/谷歌的搜索结果列表):

    搜索结果:

  • 《十大净化空气植物排行榜》—— 净化空气植物有哪些
  • 绿萝的养殖方法和注意事项 – 百度百科
  • 适合北向房间的植物 – 某园艺论坛帖
  • 虎尾兰、吊兰、常春藤的功效介绍…… (你需要自己点开 4 个网页,再结合“朝北、3 平米、好活”这些条件,自己拼出答案。)
  • AI 式回答(类似豆包 / DeepSeek / ChatGPT):

    根据你的条件(朝北 = 光照少、3 平米 = 空间小、要“好活 + 净化空气”),推荐三种:

  • 绿萝:耐阴、几乎不用管,吸收甲醛能力强,挂盆或小盆栽都行,不占地方。
  • 虎尾兰(虎皮兰):极耐旱耐阴,夜间也能释放氧气,一个月浇 1~2 次水即可。
  • 吊兰:耐阴、好养,能有效吸收一氧化碳和甲醛,垂吊摆放省空间。 小建议:朝北房间别浇太勤,三盆足够,太多反而闷。需要我帮你列个购买清单吗?
  • 差异总结: 搜索是“给你一堆线索,自己找答案”;AI 是“结合你的具体情况,直接给你定制结论,还能接着聊”。


    2.7 示例 2:用 Prompt 体验“多模态”能力(图文理解)操作步骤: 打开支持图片输入的 AI(如豆包、Gemini、ChatGPT、通义千问),点击输入框旁的“回形针/+”按钮上传一张图片(比如一张产品照片、一张旅游风景图、一张孩子画的画),然后输入下面的 Prompt:

    输入 Prompt:

    请描述这张图片,并总结 3 个要点。如果图里有文字,请一并提取出来。

    预期输出(以“一张咖啡馆照片”为例):

    描述: 这是一张室内咖啡馆的照片。木色吧台后方站着一位咖啡师,正在使用意式咖啡机;左侧靠窗有一张两人小桌,桌上有拿铁和笔记本电脑;整体光线温暖,墙面是复古砖墙。 3 个要点:

  • 场景为温馨独立咖啡馆,风格偏复古工业风。
  • 图中包含人物(咖啡师)与顾客可能的休憩动线。
  • 适合用作“探店文案”或“空间设计参考”的素材。 提取文字: 吧台招牌写着“MORNING 晨光咖啡”,价目表有“拿铁 28 元 / 美式 22 元”。
  • 说明:这就是多模态——AI 同时“看”图又“读”字又“写”文字。你换成“请翻译图中外文”“给这张图配一句朋友圈文案”也能直接用。


    2.8 练习小环节:术语连连看把左列的术语拖到(或写到)右列最匹配的解释前,检验一下自己学会了没:
    术语对应解释
    Prompt A. AI 编造的虚假信息
    幻觉(Hallucination) B. 你发给 AI 的指令或问题
    生成式 AI C. 能自主规划、调用工具干完任务的 AI
    智能体 D. 能创造新内容(文章/图片)的 AI
    上下文窗口 E. 单次对话 AI 最多能“记住”的文字量

    答案:Prompt→B,幻觉→A,生成式 AI→D,智能体→C,上下文窗口→E。全对就是合格啦!


    小结回顾

    本章要点复述:

    • AI 是“让机器感知、理解、思考、创造”的技术总称;与传统软件的根本区别是从规则驱动转向数据驱动。
    • 核心技术层层递进:机器学习→深度学习→大语言模型(LLM);在此基础上发展出推理模型、多模态、计算机视觉(CV)、语音(ASR/TTS)与智能体(Agent)。
    • 8 个必记术语:Prompt、生成式 AI、多模态、推理模型、幻觉、API、智能体、上下文窗口。
    • AI 擅长文字、分析、创作、重复脑力活;不擅长保证事实绝对正确、替你担责决策、理解真实物理世界。
    • 正确姿势:把 AI 当实习生、关键事实复核、复杂任务拆分、你始终是责任人。

    自测题(合上书本试试能否答出):

  • 传统软件和 AI 在“谁来做决定”上有何不同?
  • 用一句话比喻“大语言模型”是什么?
  • 推理模型(Reasoning Model)相比普通模型,多做了哪一步?
  • 什么是“幻觉”?遇到幻觉你该怎么做?
  • 上下文窗口(Context Window)是用什么单位来衡量的?它越大代表什么?
  • 判断:AI 可以完全替代医生做最终诊断。(对 / 错)
  • 你想让 AI 看一张图并写朋友圈文案,这属于哪种能力的体现?
  • 自测答案:1. 传统软件由人事先写死规则,AI 由模型从数据中学规律。2. 读过海量书的通才。3. 先在内部一步步思考(思维链)再回答。4. AI 编造虚假/不准确内容;应人工交叉验证、不轻信。5. token;越大一次能处理/记住的内容越多。6. 错。7. 多模态能力。


    2.9 本章实践任务光看不练容易忘,下面 3 个动手任务帮你把本章知识真正用起来。每个任务都附了「完成标准」,做完对照一下就知道自己掌握得怎么样。

    任务 1:让 AI 讲清「机器学习」与「深度学习」的区别

    打开任意一款对话 AI(豆包、DeepSeek、ChatGPT 都行),输入下面这句 Prompt:

    请用大白话解释什么是机器学习,并说明它和深度学习有什么区别,最好各举一个生活中的例子。

    • 完成标准: AI 的回答能让你用自己的话复述出「机器学习是从数据里学规律、深度学习是其中用多层神经网络学得更深的一种」,并且你能举出至少 1 个例子说明两者的不同。

    任务 2:用多模态能力「看图说话 + 提取文字」

    找一张生活照片(可以是产品包装、路牌、菜单或风景照),上传给支持图片输入的 AI(如豆包、Gemini、通义千问),并输入:

    请描述这张图片的内容,并提取图中所有文字。如果图里有英文,请顺便翻译成中文。

    • 完成标准: AI 能准确描述图片主体,并成功提取出图中文字(若图里有英文则给出翻译)。如果描述有明显错误,说明它也有「看走眼」的时候——这正是本章讲的 AI 能力边界。

    任务 3:让 AI 结合条件推荐办公室绿植

    假设你的办公桌朝北、光照少、空间有限,让 AI 推荐 3 种适合办公室的绿植,并说明理由。Prompt 可以这样写:

    我的办公桌朝北、几乎晒不到太阳,桌面空间也不大。请推荐 3 种好养活的办公室绿植,并说明为什么适合我的光照和空间条件。

    • 完成标准: AI 的推荐结合了「光照少、空间小」这两个条件,而不是泛泛而谈;每种绿植都给出了「耐阴 / 不占地方」之类的具体理由。如果它推荐的植物需要强光,说明它没真正结合你的条件——你可以追问让它重新推荐。
    2.10 主流 AI 工具分类速览了解了 AI 的能力边界后,我们再来看看市面上常见的 AI 工具都分哪些类。下面这张表帮你快速建立“工具全景认知”——以后听到某个产品,就能立刻知道它属于哪一类、能帮你干什么。
    工具类别代表产品一句话适用场景
    对话助手 豆包、DeepSeek、ChatGPT 日常问答、写作、翻译、头脑风暴,随叫随到的“全能参谋”
    AI 绘画 Midjourney、Stable Diffusion、文心一格 输入一句话生成插画、海报、头像,零基础也能做设计
    AI 编程 GitHub Copilot、Claude Code、通义灵码 写代码、补注释、找 bug,程序员的高效“结对搭档”
    AI 视频 剪映、可灵、Runway 文字/图片一键生成短视频,剪辑、配音、字幕全自动
    AI 办公 WPS AI、Notion AI、Gamma 写周报、做 PPT、整理会议纪要,把重复文书活交给它

    提示:很多工具是“多面手”——比如豆包既能聊天也能画图,DeepSeek 也能读文档。分类只是为了帮你快速理解,实际使用时大胆混搭即可。 零基础读者选型建议:

    • 日常问答:首选豆包——完全免费、中文支持好、手机 App 即开即用,问什么都接得住,是零基础入门的第一款 AI。
    • 写文案:首选DeepSeek——免费且中文写作质量高,朋友圈、小红书、公众号初稿都能写得有模有样,还支持读文档。
    • 做 PPT:首选WPS AI——如果你本来就用 WPS,无需额外装软件,一句话就能生成大纲和整套幻灯片,操作门槛最低。
    • 学编程:首选通义灵码——免费、中文界面友好,装进 VS Code 就能边写边提示,遇到报错直接问它,比翻文档快得多。
    • 画图配文:首选文心一格——免费额度够用、中文提示词理解好,输入“一只戴帽子的橘猫”就能出图,适合给文章配插画。

    小贴士:以上推荐都优先考虑“免费 + 中文友好 + 上手快”。等你用熟一款,再按「2.9 表格」里的分类去尝试更多工具,就不会眼花缭乱了。

    2.10 参考资料与延伸阅读

    想深入了解本章提到的概念,下面 5 份权威资料值得收藏。它们分别对应本章的不同知识点,按需查阅即可。

  • 图灵 1950 年论文《Computing Machinery and Intelligence》原文:https://academic.oup.com/mind/article/LIX/236/433/986238 —— 对应「2.0 AI 发展简史」中 1950 年图灵测试的原始出处,想读一手文献从这里开始。
  • 达特茅斯会议历史介绍(斯坦福哲学百科全书):https://plato.stanford.edu/entries/artificial-intelligence/ —— 对应「2.0 AI 发展简史」中 1956 年“人工智能”学科诞生的权威背景资料。
  • Vaswani 等 2017 年《Attention Is All You Need》论文(Transformer 原始出处):https://arxiv.org/abs/1706.03762 —— 对应「2.0 AI 发展简史」中 2017 年 Transformer 架构,以及「2.2 核心技术速览」中大语言模型的技术根基。
  • 国家法律法规数据库官网:https://flk.npc.gov.cn —— 对应「2.4 AI 的能力边界」中“幻觉识别小练习”的核实方法:查法律条文请以这里为准,别轻信 AI 引用的条款号。
  • 主流 AI 工具官方文档入口(以豆包为例):https://www.doubao.com —— 对应「2.9 主流 AI 工具分类速览」:想上手体验对话助手,豆包免费、中文友好,官方帮助中心有详细玩法说明。
  • 延伸建议:读论文不必逐字啃,先看摘要和结论即可;工具文档则按“想解决什么问题”去搜,效率最高。

    下一章我们将走进《第三章:主流 AI 工具分类全景》,帮你搞清楚“市面上的 AI 工具到底有哪些种类、我该用哪一个”。

    赞(0)
    未经允许不得转载:171主机测评 » 人工智能常用工具学习(二)
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址