一、学习心得
语言模型与 Transformer 架构
统计语言模型到 N-Gram
N-gram模型就是与前面出现的N-1个词有关,利用最大似然估计来计算
N-GRAM模型有两个致命缺陷,一数据稀疏性,二泛化能力差(语义相似性),把词视为孤立、离散的符号。
神经网络语言模型
用连续的向量来表示词,前馈神经网络模型是里程碑,可以用数学工具来描述词与词之间的关系,常用的方法是余弦相似度。
它解决了 N-gram 模型泛化能力差的问题,但上下文窗口是固定的
循环神经网络与长短时记忆网络
循环神经网络引入了隐藏状态向量,但它会出现长期依赖问题。长短时记忆网络加入了细胞状态和门控机制,来有效地选择信息。
Transformer架构解析
自注意力机制就是模型在处理序列中的每一个词时,都能兼顾句子中的所有其他词,并为这些词分配不同的注意力权重。权重越高,说明这个词与当前词的关联性越强,也就会在当前词的表示中占据更大比重。
多头注意力就可以比作从不同角度去观察词元之间的特征关系,然后将其做一个累计或者是权重求和,来得到一个综合向量,以得到更多的词元关系。
前馈神经网络
前馈网络的作用是从注意力层动态聚合后的信息中提取更高阶的特征。
残差连接解决了深度神经网络中的梯度消失问题,层归一化解决了模型训练过程中的内部协变量偏移问题。
为了准确描述词元的顺序或位置,而不仅仅是关注词元之间的关系,引入了位置编码。
Decoder only架构
就是不断的去预测下一个词,只保留了解码器,为了让它不去偷看后面的答案,加入了掩码自注意力。
与大语言模型进行交互
提示工程几个简单的配置参数,包括 Temperature、Top P、Top K,样本提示包括原样本提示、单样本提示和少样本提示,指令调优和思维链。
文本分词就是将文本序列转换为数字序列,分词器的作用就是定义一套规则,将原始文本切分成一个个最小的单元,也就是词元。
现代大语言模型普遍采用子词分词算法,这样可以让模型通过组合子词来理解和生成新词。
字节对列表算法解析,它的核心思想就是先把词表初始化为所有在语料库中出现过的基本字符,然后统计所有相邻词元对的出现频率,找到频率最高的一对,并把它们合并成一个新的词元,并加入词表,一直重复该操作直到词表大小达到预设的阈值。
关系到智能体的性能、成本和稳定性,比如上下文窗口限制就是以 Token 数量计算的。不同的分词器或者是不同语言,Token 数量可能相差巨大。了解文本会被如何分词,也是预估和控制智能体运行成本的关键一步。在设计提示词和解析模型输出时,如果考虑到分词器的使用,那么就会提升智能体的鲁棒性。
大语言模型的选择主要从以下几个维度进行综合评估:
大语言模型的缩放法则和模型幻觉
所谓能力涌现,是指当模型规模达到一定阈值后,会突然展现出在小规模模型中完全不存在或表现不佳的全新能力。例如,链式思考 (Chain-of-Thought) 、指令遵循 (Instruction Following) 、多步推理、代码生成等能力,都是在模型参数量达到数百亿甚至千亿级别后才显著出现的。这种现象表明,大语言模型不仅仅是简单地记忆和复述,它们在学习过程中可能形成了某种更深层次的抽象和推理能力。
幻觉是指大模型生成的内容和客观事实、用户输入或上下文信息相矛盾,或者生成了不存在的事实、实体与事件。因为大模型在训练过程中是基于人类社会的数据来进行训练的,包含了人类社会的各种偏见和刻板印象。 那么在后面为了解决幻觉,就会进行数据层面的数据清洗,引入事实性知识和强化学习等方式,从源头减少幻觉。然后在模型层面会探索新的模型架构,让模型能够表达其对生成内容的不确定性。在推理与生成层面,检索增强生成也就是 RAG,是目前缓解幻觉的有效方法之一,因为它可以在系统之外挂上外部的知识库,引导模型生成基于事实的回答。还有就是使用多步推理与验证,引导模型进一步进行自我检查或外部验证。还有就是允许模型调用外部工具,比如搜索引擎、代码解释器等,来获取实时信息,进行精确计算。
二、习题解答
根据你的要求,我已将本章内容中的知识性、概念性和原理性问题提取并作答,同时将实践性和开放性问题(以及由于提供的文本截断而缺失的概念章节)留给你自己去探索和实践。
以下是基于提供的《第三章 大语言模型基础》内容的解答:
1. 计算句子 agent works 在 Bigram 模型下的概率
根据本章提供的迷你语料库(datawhale agent learns datawhale agent works),总词数为 6。
在 Bigram(
N
=
2
N=2
N=2)模型下,句子 agent works 的概率近似为其第一个词出现的概率与条件概率的乘积:
P
(
agent works
)
≈
P
(
agent
)
⋅
P
(
works
∣
agent
)
P(\\text{agent works}) \\approx P(\\text{agent}) \\cdot P(\\text{works} \\vert{} \\text{agent})
P(agent works)≈P(agent)⋅P(works∣agent)
-
第一步:计算
P
(
agent
)
P(\\text{agent})
P(agent)
语料库中 agent 共出现 2 次,总词数为 6。
P
(
agent
)
=
2
6
≈
0.333
P(\\text{agent}) = \\frac{2}{6} \\approx 0.333
P(agent)=62≈0.333
-
第二步:计算
P
(
works
∣
agent
)
P(\\text{works} \\vert{} \\text{agent})
P(works∣agent)
词对 agent works 在语料库中出现了 1 次,而 agent 出现了 2 次。
P
(
works
∣
agent
)
=
1
2
=
0.5
P(\\text{works} \\vert{} \\text{agent}) = \\frac{1}{2} = 0.5
P(works∣agent)=21=0.5
-
最终概率计算:
P
(
agent works
)
≈
0.333
×
0.5
≈
0.167
P(\\text{agent works}) \\approx 0.333 \\times 0.5 \\approx 0.167
P(agent works)≈0.333×0.5≈0.167
2. N-gram 模型的马尔可夫假设及局限性
- 马尔可夫假设的含义:不必回溯一个词的全部历史,近似认为一个词的出现概率只与它前面有限的
n
−
1
n-1
n−1 个词有关。 - N-gram 模型的根本性局限:
- 数据稀疏性 (Sparsity):如果某个词序列从未在训练语料库中出现过,模型对其估计的概率就会直接为 0,虽然可以通过平滑技术缓解,但无法根除。
- 泛化能力差:模型将词视为孤立的符号,无法理解词与词之间的语义相似性(例如,见过 agent learns 却无法将知识泛化到语义相近的 robot learns 上)。
3. 神经网络语言模型与 Transformer 的演进与优势
循环神经网络 (RNN/LSTM):
- 如何克服局限:
- 通过引入词嵌入 (Word Embedding)(连续的向量表示)让模型具备理解语义相似性的能力,解决了泛化问题。
- 引入隐藏状态 (Hidden State) 作为“短期记忆”,让信息可以在序列中不断向后传递,打破了 N-gram 固定的上下文窗口限制。
- LSTM 进一步引入了细胞状态 (Cell State) 和门控机制 (Gating Mechanism)(遗忘门、输入门、输出门),解决了标准 RNN 面临的长距离依赖(梯度消失/爆炸)问题。
- 优势:具备“记忆”能力,理论上能够处理任意长度的序列输入,捕获历史上下文信息。
Transformer 架构:
- 如何克服局限:完全抛弃了 RNN 的循环结构,转而依赖注意力机制 (Attention) 来捕捉序列内的依赖关系。
- 优势:实现了真正意义上的并行计算,极大提升了模型处理长序列的效率和大规模训练的速度。
4. 自注意力机制(Self-Attention)与并行计算
-
自注意力机制的核心思想:允许模型在处理序列中的每一个词时,都能兼顾句子中的所有其他词,并为这些词分配不同的“注意力权重”。权重越高代表与当前词关联性越强,信息比重也越大。该机制通过生成每个词的查询 (Query)、键 (Key) 和值 (Value) 向量来进行相互打分和特征融合。
-
为什么 Transformer 能并行,而 RNN 必须串行?
RNN 的计算依赖隐状态的传递,第
t
t
t 个时间步的计算必须等待第
t
−
1
t-1
t−1 步完成,这决定了它只能按顺序(串行)处理。而 Transformer 抛弃了循环结构,通过注意力机制让所有词元在同一层中直接计算与全局其他词元的相关性,从而实现了高度并行化。
实践与探索部分
以下问题涉及实际动手操作、开放性系统设计,或由于本文档内容截断而未详细覆盖的高级概念(如 3.1.3 Decoder-Only、3.2.2 文本分词 BPE、3.3.2 模型幻觉及论文智能体设计等)。我已将这些部分保留,供你作为学习挑战进行深度探索:
补充理论研究:
- Decoder-Only 架构与完整的 Encoder-Decoder 架构的区别及其成为主流的原因(参考原书 3.1.3 节)。
- 只保留了解码器。就是不断的去预测下一个词,结构简单,易于扩展,特别适合生成模型,为了让它不去偷看后面的答案,加入了掩码自注意力。
- BPE 分词算法解决了什么问题,为何不能直接使用“字符”或“单词”(参考原书 3.2.2 节)。
- 解决了词表爆炸、未登录词以及语义关联缺失的问题。因为一个语言当中,它的字符或者单词是非常庞大的数量,而且也没办法去扩展推断与它语义相近的词语。
- Transformer 中位置编码 (Positional Encoding) 的具体实现原理及其不可或缺的作用(原书 3.1.2 节后续部分)。
- 会把一个语句中所有词的位置和排序情况用数学关系来表达,这样就可以把它们在这个词句的位置完全固定下来,后面对于高并发的词元之间的权重关系计算有很大帮助。
动手部署与提示工程实践:在本地部署轻量级模型(如 openbmb/MiniCPM5-2B),观察采样参数调整的影响,并对比 Zero-shot、Few-shot、Chain-of-Thought 的效果。 
开放性系统与架构设计:
-
企业级客服智能体模型选型及考虑因素(闭源 vs 开源比较)。
主要从以下几个维度进行综合评估:
- 性能与能力
- 成本
- 速度
- 上下文窗口
- 部署方式
- 生态与工具链
- 可微调性与定制化
- 安全性与伦理
基于以上考量及技术栈,在当前大模型矩阵中,我选择qwen-3.7-plus,作为企业级客服智能体的模型。
-
缓解模型幻觉(Hallucination)的工作原理、适用场景。
- 幻觉是指大模型生成的内容和客观事实、用户输入或上下文信息相矛盾,或者生成了不存在的事实、实体与事件。因为大模型在训练过程中是基于人类社会的数据来进行训练的,包含了人类社会的各种偏见和刻板印象。那么在后面为了解决幻觉,就会进行数据层面的数据清洗,引入事实性知识和强化学习等方式,从源头减少幻觉。然后在模型层面会探索新的模型架构,让模型能够表达其对生成内容的不确定性。在推理与生成层面,检索增强生成也就是 RAG,是目前缓解幻觉的有效方法之一,因为它可以在系统之外挂上外部的知识库,引导模型生成基于事实的回答。还有就是使用多步推理与验证,引导模型进一步进行自我检查或外部验证。还有就是允许模型调用外部工具,比如搜索引擎、代码解释器等,来获取实时信息或者进行精确计算。
-
论文辅助阅读智能体的基座选型、长文本窗口解决方案以及确保生成严谨客观的设计思路。
- 模型选择:我选择多模态模型,比如 DeepSeek-V4.1-Flash 或者Qwen-3.8-Flash,论文可能有很多种语言或者图表,那么在进行辅助阅读时,不免就要会使用到截图或者翻译。
- 长文本窗口解决方案:可以使用压缩、上下文预算与卸载、shema递进加载、跨会话记忆策略,具体参考我最近看的一篇文章Agent 长任务上下文工程解析:用预算控制、压缩、todo-state 和记忆对抗上下文溢出与目标丢失。
- 生成严谨客观:将模型的 Temperature 设为 1,Top P 设为 0.9。同时要求模型在生成回答时,如果引用了外部文章或数据,要标出数据引用来源,方便核实。


