欢迎光临
我们一直在努力

【AI入门】大模型介绍全解析:从模型、LLM 到提示词与嵌入

👋 欢迎阅读

🏠个人主页:愿旖旎 📘专栏传送门:算法专栏 💻当前学习内容:LangChain


📑 目录

一、知识前置讲解

二、认识模型

三、认识大语言模型

四、提示词编写

五、LLM 的接入方式

六、嵌入式模型

七、复盘(附答案)


一、前置讲解

在进入正文前,先花 10 秒了解本篇会反复用到的核心概念,带着印象去读正文,学习效率更高。

🧠 前置知识一:什么是模型

从数据中学习规律、能完成特定任务的"数学函数",是 AI 的基本单元。

📐 前置知识二:神经网络与参数

模型的大脑:由大量参数组成的多层"判断流水线",规模决定能力。

📚 前置知识三:自监督学习与半监督学习

模型的学习方式:从无标注数据自己找规律,或用少量标注结合大量无标注。

⌨️ 前置知识四:语言模型与提示词

模型的交互接口:语言模型是"自动补全器",提示词是我们下指令的方式。

🧮 前置知识五:嵌入与向量

把文字/图片翻译成数字(向量)以便计算机计算,是语义搜索、RAG 的基础。


二、认识模型

模型是一个从数据中学习规律的"数学函数"或"程序"。给它喂入海量数据,它就能学会预测、生成文本或图像,从而增强各行各业的业务能力。

打个比方,可以把模型想象成一家"超级加工厂":

  • 训练师先给它看海量例子(数据),并告诉它该怎么做;

  • 它看多了,自己摸索出一套规则,从此输入原料(数据)→ 输出成品(结果)。

举个具体例子,给模型输入这些数据:

输入输出
[1, 2, 3] 2
[4, 5, 6] 5

模型学会的规律是"输出中间那个数"。学成之后,再输入 [8, 9, 10],它就能预测输出 9。

模型的三个关键属性:

属性说明
特定任务 一个模型通常只擅长一件事——识别图片里是不是猫、预测明天会不会下雨、判断评论是好评还是差评
需要标注数据 训练这类模型需要大量"标准答案"(如成千上万张标注好"是猫/不是猫"的图片)
参数较少 参数是模型从数据中学到的"内部规则",参数少 = 模型复杂度和能力相对有限

模型 = 学出来的规则,不是人写死的程序——给它数据,它自己总结规律,然后对新输入做预测。


三、认识大语言模型

3.1 什么是大语言模型

大语言模型(Large Language Model,LLM)是基于大规模神经网络(参数规模通常达数十亿至万亿级别,如 GPT-3 有 1750 亿参数)、通过自监督或半监督方式在海量文本上训练的语言模型。

拆开来看,它由四个核心概念构成:

① 神经网络 —— 模型的"大脑"

神经网络模仿人脑的工作方式,是一个"团队工作流程"。教小朋友识别猫时,不会只给一条规则("有胡子就是猫"?兔子也有胡子),而是让他看很多猫的图片——视觉神经协同工作:

神经元分工负责识别
神经元 A 尖耳朵
神经元 B 胡须
神经元 C 毛茸茸的尾巴

这些神经元一层层传递和组合信息,最后大脑综合判断:"这是猫!"

神经网络就是模拟这个过程:由大量虚拟的"神经元"(参数)和连接组成,前一层输出作为后一层的输入。通过海量数据训练,网络自动调整每个参数的值,最终形成一套复杂的"判断流水线"——有的参数负责识别猫的眼睛,有的负责识别轮廓。

② 自监督学习 —— 自己给自己当老师

想象自学一门外语:没有老师出题批改,那就拿一本小说自己玩"完形填空"——随机盖住一个词,根据上下文猜它是什么。一开始猜得乱七八糟,但看了成千上万本书后,语法、词汇搭配、上下文逻辑都了如指掌,甚至能自己写出流畅文章。

自监督学习就是“完形填空”的过程:

步骤做法
面对数据 海量没有标签的原始文本(互联网上的文章、网页)
创造任务 遮住一句话中间的词,根据上下文预测
反复练习 亿万次练习后,深刻学会语言规律,完全不需要人工标注语法成分

自监督学习 = 让模型从数据本身找规律,自己给自己当老师。

③ 半监督学习 —— 少量名师 + 海量自学

用学做菜打比方:

来源相当于作用
师傅教的招牌菜(麻婆豆腐、宫保鸡丁) 少量"有标注数据" 打下基本功
尝遍天下美食、自己研究门道 海量"无标注数据" 自己摸索规律

结合师傅教的基本功 + 自己的品尝经验,最后不仅能复刻招牌菜,还能创新出新菜式。

半监督学习 = 少量标注数据 + 大量无标注数据,共同提升学习效果。

④ 语言模型 —— "超级自动补全"

手机打字时输入"今天天气真",输入法会自动提示"好、不错、冷"——输入法内部就有一个小型语言模型:根据前文,计算下一个词最可能是什么。大语言模型就是这个逻辑的"超级放大版"。

3.2 大语言模型总结

大语言模型 = "大规模神经网络"(超级团队工作流程)+ 数百亿/万亿"参数"(脑细胞)+ "语言模型"(超级自动补全),通过自监督/半监督学习,从互联网海量文本中学会了语言规律。

四大特点:

特点说明
规模巨大 参数数十亿至万亿级,能处理更复杂全面的信息(百万大军 vs 小分队)
通用性强 学到的是语言世界的底层规律(语法、逻辑、知识关联),能举一反三,涌现出聊天、翻译、写代码等能力
训练方式不同 主要靠自监督学习从无标注文本自学,不依赖昂贵的人工标注,所以能做很大
交互方式革命 不用点按钮/写代码,直接用自然语言下指令(Prompt),说"写一首关于春天的诗"就能写

四、提示词编写

4.1 核心思想:换位思考

假设 AI 对你的信息一无所知,你需要清晰、具体、无歧义地告诉它:

要素说明
要什么 明确目标
在什么背景下 提供上下文
以什么方式呈现 指定输出形式

再配合示例、角色扮演、具体约束、迭代优化,沟通效果显著提升。

4.2 CO-STAR 结构化框架

先看对比,感受差距:

❌ 优化前(模糊低效):

我该怎么吃才能更健康?

✅ 优化后(清晰有效):

角色:你是一个基于科学证据的 AI 营养顾问。重要约束:所有建议仅为通用信息,不能替代专业医疗诊断;给出具体建议前必须声明免责条款。

任务:基于以下用户信息,提供个性化每日饮食原则性建议。

用户信息:年龄 30 岁 · 男性 · 目标减脂增肌 · 办公室久坐,每周 3 次力量训练

回答要求:

  • 先输出免责声明

  • 核心原则围绕"控制总热量摄入,确保充足蛋白质"

  • 早餐/午餐/晚餐/训练加餐各给 1 条核心建议

  • 推荐 2 种适合的健康零食

  • 不推荐任何保健品或药物

  • 输出格式:【免责声明】→【核心原则】→【分餐建议】→【健康零食推荐】

    为什么有效:把角色、约束、任务、背景、输出格式全部显式化,模型不再"猜"你的意图。

    4.3 少样本提示(Few-shot Prompting)

    给 AI 提供一两个"输入-输出"示例,让它照葫芦画瓢——不是在"下指令",而是在"教"它你想要的格式、风格和逻辑。

    适用场景:格式固定、风格独特、逻辑复杂的任务(风格仿写、数据提取、复杂格式生成)。

    示例对比:

    方式提示词
    ❌ 零样本 2 🦜 9 等于多少?
    ✅ 少样本 根据以下示例处理问题。示例1:2 🦜 3 = 5;示例2:4 🦜 7 = 11;现在请分析:2 🦜 9 等于多少?

    优势:通过示例隐式传递规则,比文字描述更直观,尤其适合符号或自定义逻辑场景。

    4.4 零样本链式思考(Zero-shot-CoT)

    在提示词末尾加一句"魔法短语"——"请一步步进行推理并得出结论",强制 AI 在给出答案前先进行内部推理。

    适用场景:任何需要一点逻辑思考的问题,即使你不清楚具体步骤。

    示例:

    罗杰有五个网球,他又买了两盒网球,每盒有3个网球,请问他现在总共有多少个网球?请一步步进行推理并得出结论。

    AI 输出:

    罗杰最初有5个网球。 买来的网球数量:2 × 3 = 6个。 因此总共有:5 + 6 = 11个。 答案:11个网球。

    本质:这句指令相当于引导模型的"注意力机制"——告诉模型"在生成最终答案前,先在文本序列中模拟出一个缓慢、有序的推理上下文",从而减少跳跃式错误。

    4.5 自我批判与迭代

    要求 AI 生成答案后,从特定角度审查并优化自己的答案——把"生成"和"评审"两个步骤分离,利用 AI 的批判性思维提升质量。

    适用场景:代码审查、文案优化、论证强化、安全检查。

    示例:编写代码后自检

    方式提示词
    ❌ 优化前 写一个Python函数,计算列表中的最大值。
    ✅ 优化后 步骤一:写一个 Python 函数 find_max;步骤二:请从代码健壮性和可读性角度审查(空列表如何处理?命名是否清晰?给出优化后的最终版本)。

    五、LLM 的接入方式

    直接与大模型提供方交互的方式有三种:

    方式一句话概括
    API 远程调用 调云端现成接口,最主流
    开源模型本地部署 模型跑在自己机器上
    SDK 官方客户端库 API 的封装,写代码更顺手
    5.1 API 接入(最主流)

    适合:快速开发、集成到现有应用、不想管理硬件资源。

    通过 HTTP 请求(RESTful API)直接调用云端的模型服务。代表厂商:OpenAI (GPT-4o)、Anthropic (Claude)、Google (Gemini)、百度文心一言、阿里通义千问、智谱 AI 等。

    典型流程:

    步骤做法
    1. 注册获取 API Key 平台注册,获得身份验证密钥
    2. 查阅 API 文档 了解端点、参数(模型名/提示词/温度/最大长度)
    3. 构建 HTTP 请求 用 requests 等库,Key 放 Header,提示词放 JSON 请求体
    4. 发送并处理响应 解析 JSON,提取生成文本

    官方地址:https://platform.openai.com/

    📷 插图位置:API 调用流程图 / 平台界面截图

    5.2 本地部署(数据安全/离线)

    把开源 LLM(Llama、ChatGLM、Qwen 等)部署在自己硬件上——下载权重,用推理框架加载运行,再按类似 API 的方式交互。

    典型流程:

    步骤做法
    1. 获取模型 Hugging Face(国外)、魔搭社区(国内)下载权重
    2. 准备环境 NVIDIA GPU + 驱动 + 推理框架
    3. 选推理框架 见下表
    4. 启动服务 本地 API 服务器(如 http://localhost:8000),像云端 API 一样调用
    推理框架特点
    vLLM 高吞吐量推理,性能极佳
    TGI Hugging Face 出品,功能全面
    Ollama 一键拉取运行,小白友好
    LM Studio 图形化界面,像用软件一样跑模型

    以 Ollama 为例:

    ① 下载:官方地址 Ollama

    📷 插图位置:Ollama 官网/下载界面截图

    ② 拉取模型:

    事项说明
    默认存储路径 C:\\Users\\XXX\\.ollama
    改路径方式一 配置环境变量 OLLAMA_MODELS = ${自定义路径}
    改路径方式二 Ollama 界面设置
    查找模型 Ollama
    下载并运行 ollama run deepseek-r1:1.5b

    📷 插图位置:存储路径设置 / 模型搜索界面截图

    5.3 SDK 接入(API 的封装)

    本质上是对 API 的封装简化——官方 SDK 封装底层 HTTP 细节,提供符合编程习惯的函数库。

    pip install openai

    from openai import OpenAI
    client = OpenAI(api_key="your-api-key")
    response = client.responses.create(
       model="gpt-5",
       input="介绍一下你自己。"
    )
    print(response.output_text)


    六、嵌入式模型

    6.1 认识嵌入模型

    先区分两类模型:

    模型目标
    大语言模型(生成式) 理解输入并生成新文本(回答问题、写文章)。内部也使用嵌入技术,但目标是"创造"
    嵌入模型(表示式) 不生成文本,而是为输入创建富含语义的数值表示(向量)

    嵌入(Embedding)的核心思想:计算机擅长数字,但不理解文字、图片。嵌入就是把人类符号(单词、句子、产品、用户、图片)转换成数字列表(向量),并且保留原始语义和关系——相当于把人类语言"翻译"成计算机的"数学语言"。

    关键结论:既然是"数学语言",就能用数学方式比较向量(相似度),从而实现"度量语义"。

    6.2 嵌入模型的应用场景

    ① 语义搜索(Semantic Search)

    方式原理优势
    传统搜索 关键词匹配 简单直接
    语义搜索 查询和文档都转成向量,算相似度 即使没有确切关键词也能检索到

    ② 检索增强生成(RAG)—— 当前 LLM 应用的核心模式

    环节说明
    用户提问 例如"今年新增的带薪育儿假政策具体怎样"
    语义搜索 嵌入模型在知识库(人事制度文档、福利备忘录)中找到相关条款
    交给 LLM 将【条款】+【问题】一起提交,生成准确具体的摘要

    好处:答案准确且时效性强(解决知识陈旧问题),而不是凭训练数据"瞎编"。

    ③ 推荐系统

    原理:用户和物品都转成向量——喜欢相似物品的用户向量接近,相似物品的向量也接近,算相似度即可精准推荐。

    案例:用户 A 喜欢《盗梦空间》《黑镜》,系统发现与"也喜欢这两部"的用户向量很接近,而这些用户普遍还喜欢《星际穿越》——尽管 A 从没看过,系统仍会推荐它。

    ④ 异常检测

    原理:正常数据的向量聚集在一起;新数据向量远离聚集区 = 可能是异常点(垃圾邮件、欺诈交易)。

    案例:信用卡反欺诈——海量正常交易的向量形成"正常聚集区",当一笔高额异地交易出现,向量落在聚集区外,系统自动标记为潜在欺诈并告警。


    七、复盘(附答案)

    💡 思考题

  • 什么是模型?为什么说"模型是一套从数据中学到的规则",而不是人为写死的程序?

  • 大语言模型与"传统小模型"最核心的区别有哪些?(提示:规模、通用性、训练方式、交互方式)

  • 为什么"自监督学习"能在不需要人工标注的情况下学会语言规律?请用"完形填空"比喻解释。

  • 提示词为什么重要?"少样本提示"和"零样本链式思考(Zero-shot-CoT)"分别靠什么提升效果?

  • LLM 的三种接入方式(API / 本地部署 / SDK)各适合什么场景?嵌入模型如何实现"语义搜索",RAG 又为什么能解决知识陈旧?

  • 📝 答案

  • 模型是从数据中学习规律的"数学函数"。训练师给它看海量例子,它自己摸索出规则,而不是程序员手写规则。学成后给新输入,它能根据学到的规律预测输出——所以模型本质是"学出来的规则/模式"。

  • 四点区别:规模巨大(参数数十亿到万亿级);通用性强(学到语言底层规律,能举一反三、涌现多种能力);训练方式不同(自监督学习,无标注自学,不依赖人工标注);交互方式革命(自然语言 Prompt 直接对话,不用写代码)。

  • 自监督学习 = "完形填空":模型面对海量无标签文本,自己给自己创造任务——遮住一个词、根据上下文预测它。亿万次练习后,深刻学会语法、词汇搭配与逻辑,因此不需要人工标注,自己就能当自己的老师。

  • 提示词是模型理解需求的唯一通道,"清晰、具体、无歧义"才能得到高质量输出。少样本提示给一两个"输入-输出"示例,让模型照葫芦画瓢、隐式传递格式规则;零样本链式思考在末尾加"请一步步推理",强制模型先生成有序推理过程再作答,显著提升逻辑题正确率。

  • API:最主流,适合快速开发、不想管理硬件;本地部署:适合数据敏感、需离线/高性能场景(vLLM/TGI/Ollama 等框架);SDK:本质是 API 封装,代码更符合编程习惯。嵌入模型把文本转成向量,用相似度做语义匹配——没有确切关键词也能检索到;RAG 先检索知识库相关内容、再连同问题交给 LLM,注入实时外部知识,从而解决训练数据过时的问题。


  •  🎯 闭幕

    从"模型是什么"到"大语言模型",从"提示词工程"到"LLM 接入方式",再到"嵌入模型与 RAG"——这一篇帮你把大模型的入门地图走了一遍。

    如果本文对你有帮助,欢迎:

    👍 点赞 | ⭐ 收藏 | 👤 关注作者| 💬 留言交流你的疑问或补充

    你的每一次互动都是我继续更新的动力,我们下一篇见!🚀

    赞(0)
    未经允许不得转载:171主机测评 » 【AI入门】大模型介绍全解析:从模型、LLM 到提示词与嵌入
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址