欢迎光临
我们一直在努力

第07课:大语言模型与文本生成——让AI成为你的“全能写手“

📌 本课学习目标

学完这节课,你能搞明白以下问题:

  • 大语言模型(LLM)到底是什么?它和我们平时用的输入法联想功能有什么区别?
  • AI写文章是一口气写完的,还是一个字一个字"蹦"出来的?
  • Token、上下文窗口、Temperature这些词是什么意思?
  • ChatGPT、DeepSeek、文心一言、Kimi这些模型各有什么特点?怎么选?
  • 🤔 课前思考

    你打开ChatGPT或豆包,输入"帮我写一段产品介绍",几秒钟后,一段通顺流畅的文案就出来了。

    但你有没有想过:

    • AI是怎么知道该写什么内容的?它是不是从网上抄的?
    • 它写出来的文字为什么读起来这么自然?像人写的?
    • 同样的问题问两遍,为什么两次的回答不一样?

    这节课,我们就来揭开大语言模型的"写作之谜"。


    一、大语言模型(LLM)是什么?

    LLM = Large Language Model = 大语言模型

    拆开来看:

    • 大:参数特别多(几十亿到上万亿个),训练数据特别大,几乎读了互联网上所有的文字
    • 语言:专门处理文字内容,不处理图片、声音,那是其他模型的活
    • 模型:经过训练的、能完成特定任务的AI系统

    用一个类比来理解

    大语言模型就像一个读过全世界所有书、看过所有文章的"超级语文老师"。

    你问它任何问题,写文案、改论文、翻译语言、解释概念、甚至写代码,它都能应对。不是因为它"死记硬背"了所有内容,而是因为它已经从海量文字中学会了语言规律,能根据你的需求现场"创作"。

    LLM的两大核心能力

    能力白话解释生活例子
    语言理解 能读懂你说什么、你的意思是什么 你说"帮我写个请假条,理由是感冒",它知道不是真的要请假,而是要生成一份请假条文本
    语言生成 能根据理解的意思,组织出通顺的文字 输入"请假条"的要素,它输出格式规范的请假条全文

    理解是前提,生成是结果,先听懂你说的,再给你写出你想要的。


    二、LLM是怎么写文章的?——"逐字预测"的秘密

    这是大语言模型最核心、也最反直觉的机制。

    你以为的:AI"一口气"写出整篇文章

    输入 → AI思考 → 完整文章输出

    实际上的:AI每次只是在猜"下一个字"

    输入:"今天天气真" → AI猜下一个字 → "好"
    输入:"今天天气真好," → AI猜下一个字 → "适合"
    输入:"今天天气真好,适合" → AI猜下一个字 → "出去"
    输入:"今天天气真好,适合出去" → AI猜下一个字 → "走走"
    … 一直猜到结束标记

    没错,大语言模型生成文字的本质其实就是:根据前面的内容,预测下一个最可能出现的词,本质上是在进行概率预测!

    为什么听起来这么自然?

    因为AI读过海量的文字数据,它"知道"什么词后面通常应该跟什么词。

    就像你说话的时候,也不是先想好整句话再说出来,而是一个词一个词地往外蹦。但因为你积累了多年的语言经验,说出来的话自然是通顺的。

    AI也一样,它积累了几乎所有人类的文字经验,所以它"蹦"出来的词也是通顺的、有逻辑的。

    一个关键参数:Temperature(温度值)

    你问AI同一个问题,它为什么每次回答都不一样?这就跟Temperature有关。

    Temperature值效果类比
    0 每次都选概率最高的词,结果最稳定、最保守 一个人做选择题永远选最确定的答案
    0.7(常用) 有一定随机性,既有创造性又不离谱 一个人说话偶尔换种说法
    1.5 随机性很大,很有创造力但可能"胡说八道" 一个人喝醉了说话天马行空

    日常使用建议:写正式文档用0-0.3,写创意内容用0.7-1.0,不要超过1.5。

    AI为什么不会"一直写下去"?

    因为训练时,AI学会了识别"什么时候该停",当它预测到下一个词是特殊的"结束标记"时,就会停止生成,这就像你说话说到该停的地方自然就会停了一样。


    三、三个核心技术概念(通俗版)

    这三个概念你会在各种AI工具里反复遇到,搞懂了就不再迷糊。

    概念一:Token——AI眼中的"词语单位"

    你输入一段话给AI,AI不会按"字"来处理,而是按"Token"来处理。

    Token是什么? 简单说,就是AI切分文本的基本单位。

    "今天天气真好" → Token切割 → ["今天", "天气", "真", "好"]
    "ChatGPT" → Token切割 → ["Chat", "G", "PT"]
    "人工智能" → Token切割 → ["人工", "智能"]

    • 常见的中文词通常是1个Token
    • 英文单词通常是1个Token
    • 很长的词或生僻词可能被拆成多个Token
    • 标点符号也是Token

    为什么要了解Token? 因为AI工具的收费和限制都是按Token计算的。比如"上下文窗口128K tokens",并不是说能输入128K个汉字(中文大约1个字≈1-2个Token),所以128K tokens大约能处理6-8万汉字。

    概念二:上下文窗口——AI的"短期记忆"

    AI每次对话时,能"记住"的最大的内容量就是上下文窗口。

    你的问题 + AI的回答 + 之前所有的对话内容 ≤ 上下文窗口

    类比:你参加一场考试,考试时间有限,你能在有限时间内读完、处理的内容量就是你的"上下文窗口"。

    不同模型的上下文窗口大小:

    模型上下文窗口大约能处理多少汉字
    GPT-4o 128K 6-8万字
    Claude 3.5 200K 10-13万字
    Kimi 200K 10-13万字
    DeepSeek 64K 3-4万字

    实用建议:

    • 聊天时不超出当前上下文窗口,AI就不会"忘了前面说了什么"
    • 处理长文档时可以选上下文窗口大的模型,比如如Kimi、Claude
    • 超出窗口的旧对话会被"挤出"记忆,AI就看不到了,会忘了之前的话题和内容

    概念三:预训练 + 微调——先"通识教育"再"专业培训"

    这是大模型训练的两个阶段:

    预训练(通识教育)
    │ 读互联网上几乎所有文字 → 学会语言规律 → 成为"什么都知道一点的通才"


    微调(专业培训)
    │ 用特定领域的数据继续训练 → 成为"某个领域的专家"


    最终模型 = 通识基础 + 专业特长

    类比:

    • 预训练 = 一个人从小学到高中,学语文、数学、英语、物理、化学……什么都有基础
    • 微调 = 大学选了个专业,比如医学,深入学习某一领域的知识

    ChatGPT是"预训练"出来的通才。如果你想让它变成"法律专家",就给它大量的法律文书做"微调",这就是为什么不同的企业可以定制属于自己的AI助手。


    四、主流大语言模型怎么选?

    目前市面上主流的大语言模型有很多,不需要全用过,但要知道各自的特点。

    国内模型(免费或低成本,中文能力强)

    模型开发方核心特点最适合场景
    DeepSeek 深度求索 开源先锋,性价比极高,推理能力突出 技术问题、编程辅助、日常使用
    Kimi 月之暗面 超长上下文(200K),擅长处理长文档 读长论文、分析长报告、处理长对话
    通义千问 阿里巴巴 开源生态好,多模态能力强 代码生成、企业应用开发
    文心一言 百度 中文理解能力强,百度生态集成 中文写作、中文理解任务
    豆包 字节跳动 免费好用,响应快 日常问答、快速文案生成

    国外模型(功能更强,部分需付费)

    模型开发方核心特点最适合场景
    GPT-4o OpenAI 全球最知名,综合能力最强 通用场景、复杂推理、多模态
    Claude 3.5 Anthropic 超长上下文,擅长长文本分析和写作 长文档分析、高质量写作、代码

    怎么选?按场景来

    你的需求推荐模型理由
    日常问答、写文案 豆包 / DeepSeek 免费好用,中文能力强
    分析长文档/论文 Kimi / Claude 上下文窗口大,不会"忘了前面"
    写代码/技术问题 DeepSeek / GPT-4o 代码理解和生成能力强
    企业定制AI助手 通义千问(开源) 可以私有化部署,数据不出企业
    预算充足要最强效果 GPT-4o / Claude 3.5 综合能力天花板

    五、极简API调用示例

    如果你想在自己的程序中调用大模型,其实非常简单,主流模型都兼容OpenAI的API格式。

    // 调用DeepSeek API的请求示例
    POST https://api.deepseek.com/v1/chat/completions
    {
    "model": "deepseek-chat",
    "messages": [
    {
    "role": "system",
    "content": "你是一个专业的产品文案写手"
    },
    {
    "role": "user",
    "content": "用一句话介绍什么是AI"
    }
    ],
    "temperature": 0.7
    }

    // 返回结果
    {
    "choices": [
    {
    "message": {
    "role": "assistant",
    "content": "AI(人工智能)就是让计算机模拟人类的思考和行为,从识别图片到写文章,帮你把复杂问题变简单的技术。"
    }
    }
    ]
    }

    核心就三步:

  • 准备API密钥,各大模型平台注册就能拿到
  • 按格式发送请,指定模型 + 对话内容
  • 接收返回的文字结果
  • 不需要懂深度学习的原理,会发HTTP请求就能调用。


    🏢 业务场景实战

    场景一:程序员用LLM辅助写代码

    比如现在有一个Java程序员遇到了某个问题:不会用某个库。

    以前:Google搜索 → 翻Stack Overflow → 试了几个方案 → 半小时解决

    现在:现在把问题直接扔给DeepSeek/Claude → 给出完整代码 + 解释 → 5分钟解决

    输入:"Java中怎么用Stream把一个List<User>按年龄分组?"
    输出:
    Map<Integer, List<User>> result = users.stream()
    .collect(Collectors.groupingBy(User::getAge));
    // 按年龄分组,年龄相同的用户会被放到同一个List中

    LLM不是替代程序员写代码,而是充当一个"随时都在的、什么语言都懂的编程搭档"。

    场景二:新媒体运营用LLM批量生成内容

    一个小红书运营每天要发5条笔记,每条需要标题+正文+标签。

    工作流:

    1. 把产品信息整理成模板
    2. 输入给LLM:"帮我写5条小红书笔记,产品是保湿面膜,卖点是玻尿酸成分、敏感肌可用、平价,风格活泼有感染力"
    3. LLM生成5版初稿
    4. 运营挑选修改,配上图片发布

    效率提升:从每天花3小时写内容,变成30分钟审核修改。

    场景三:企业用API打造专属AI客服

    通过调用大模型API,企业可以快速搭建一个"懂自己业务"的AI客服系统:

    用户提问 → API调用(附带企业知识库作为上下文) → LLM生成专业回答

    比如用户问"你们的退换货政策是什么?",系统会把企业的退换货规则作为上下文传给LLM,LLM就会基于企业自己的政策来回答,而不是给出通用的回复。


    ✅ 本课知识卡片

    ┌─────────────────────────────────────────────────┐
    │ 第07课 · 大语言模型核心概念速查 │
    ├─────────────────────────────────────────────────┤
    │ LLM = 专门处理文字的大模型 │
    │ 两大能力:语言理解 + 语言生成 │
    │ │
    │ 生成原理:逐字预测下一个最可能的词 │
    │ Temperature:控制创造性(0=保守,1=发散) │
    │ │
    │ 三大核心概念: │
    │ Token = AI切分文本的单位(收费和限制都按它算) │
    │ 上下文窗口 = AI的"短期记忆"容量 │
    │ 预训练+微调 = 先通识教育再专业培训 │
    │ │
    │ 选模型:日常用豆包/DeepSeek,长文档用Kimi/Claude │
    │ 写代码用DeepSeek/GPT-4o │
    └─────────────────────────────────────────────────┘


    🔗 下一课预告

    前面所有课程讲的大模型,主要处理的是文字。但现在的AI不仅能写文章,还能看图片、听语音、生成视频——这种"全能型"AI叫什么?它是怎么同时处理这么多类型信息的?

    下一课:多模态大模型——让AI"看、听、说"样样精通


    好途工坊 · 好途相伴,前程无忧

    赞(0)
    未经允许不得转载:171主机测评 » 第07课:大语言模型与文本生成——让AI成为你的“全能写手“
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址