第1章 LLM概述 —— 学习笔记
一、先搞清楚名字
LLM,全称 Large Language Model,翻译过来就是大语言模型。
别被这个名字吓到,我拆开给你讲:
- Language Model(语言模型):说白了就是一个特别会说话的程序。你给它一句话的前半截,它能猜出后半截。比如你输入"今天天气真",它大概率会接"好"而不是"吃"。
- Large(大):大在哪?接着往下看。
二、LLM 到底是咋训练出来的?
想象一下你教一个婴儿学说话:
- 你不会一上来就教他语法课,而是让他天天听大人说话,听多了自然就会说了。
- LLM 的训练思路完全一样:给它海量的文本(书籍、网页、论文、新闻……),让它自己去"听",听多了它就学会了语言的规律。
区别在于:这个"婴儿"听的是整个互联网的文本量,而且可以24小时不睡觉地听。所以它学得又快又多,自然就"大"了。
三、LLM 的"大"到底大在哪?
教材原文说得很清楚,大在三个地方:
| 参数量大 | 参数就像模型大脑里的"神经元连接",越多越聪明 | GPT-3 有 1750 亿个参数 |
| 训练数据大 | 吃的"精神食粮"多到离谱 | 几百GB到几TB的文本 |
| 能力强 | 会的东西多,干啥都行 | 问答、翻译、写代码、写论文…… |
你可以这样理解:
参数量决定了这个模型"脑子有多大",训练数据决定了它"读了多少书",能力强就是它"考试成绩好"。
四、LLM 能干啥?
教材提到了多种能力,我给你归个类:
1. 理解类
- 你发一段话,它能明白你在说什么
- 例如:阅读理解、情感分析
2. 生成类
- 你给个开头,它能接着往下写
- 例如:写文章、写代码、对话
3. 推理类
- 它能进行逻辑思考
- 例如:数学题、因果推理
4. 跨任务泛化
- 这个最厉害——同一个模型,啥任务都能干
- 以前做翻译要用翻译模型、做问答要用问答模型,现在一个 LLM 全搞定
教材原文的原话是:
“能够在问答、摘要、翻译、编程等多种场景下展现出类似人类的语言理解和表达水平”
翻译成人话就是:这玩意儿基本啥都能聊,而且聊得还不错。
五、有哪些代表选手?
教材提到了三个系列,我给你快速认识一下:
| GPT 系列 | OpenAI(美国) | 大模型界的"鼻祖",ChatGPT 就是它的崽 |
| DeepSeek 系列 | DeepSeek(中国) | 国产之光,开源界的扛把子 |
| Qwen 系列 | 阿里巴巴 | 阿里的通义千问,同样开源,生态很全 |
当然还有 Gemini(Google)、Claude(Anthropic)等等,我们在第2章会展开讲。
六、一句话总结第1章
如果有人问你"LLM 是什么?",你就说:
LLM 就是在海量文本上训练出来的大型语言模型,参数多、数据多、本事大,能理解、能生成、能推理,一个模型干所有语言相关的活儿。

