欢迎光临
我们一直在努力

第1章 LLM概述

第1章 LLM概述 —— 学习笔记

一、先搞清楚名字

LLM,全称 Large Language Model,翻译过来就是大语言模型。

别被这个名字吓到,我拆开给你讲:

  • Language Model(语言模型):说白了就是一个特别会说话的程序。你给它一句话的前半截,它能猜出后半截。比如你输入"今天天气真",它大概率会接"好"而不是"吃"。
  • Large(大):大在哪?接着往下看。

二、LLM 到底是咋训练出来的?

想象一下你教一个婴儿学说话:

  • 你不会一上来就教他语法课,而是让他天天听大人说话,听多了自然就会说了。
  • LLM 的训练思路完全一样:给它海量的文本(书籍、网页、论文、新闻……),让它自己去"听",听多了它就学会了语言的规律。

区别在于:这个"婴儿"听的是整个互联网的文本量,而且可以24小时不睡觉地听。所以它学得又快又多,自然就"大"了。

三、LLM 的"大"到底大在哪?

教材原文说得很清楚,大在三个地方:

大在哪通俗解释举个例子
参数量大 参数就像模型大脑里的"神经元连接",越多越聪明 GPT-3 有 1750 亿个参数
训练数据大 吃的"精神食粮"多到离谱 几百GB到几TB的文本
能力强 会的东西多,干啥都行 问答、翻译、写代码、写论文……

你可以这样理解:

参数量决定了这个模型"脑子有多大",训练数据决定了它"读了多少书",能力强就是它"考试成绩好"。

四、LLM 能干啥?

教材提到了多种能力,我给你归个类:

1. 理解类

  • 你发一段话,它能明白你在说什么
  • 例如:阅读理解、情感分析

2. 生成类

  • 你给个开头,它能接着往下写
  • 例如:写文章、写代码、对话

3. 推理类

  • 它能进行逻辑思考
  • 例如:数学题、因果推理

4. 跨任务泛化

  • 这个最厉害——同一个模型,啥任务都能干
  • 以前做翻译要用翻译模型、做问答要用问答模型,现在一个 LLM 全搞定

教材原文的原话是:

“能够在问答、摘要、翻译、编程等多种场景下展现出类似人类的语言理解和表达水平”

翻译成人话就是:这玩意儿基本啥都能聊,而且聊得还不错。

五、有哪些代表选手?

教材提到了三个系列,我给你快速认识一下:

选手出品方一句话介绍
GPT 系列 OpenAI(美国) 大模型界的"鼻祖",ChatGPT 就是它的崽
DeepSeek 系列 DeepSeek(中国) 国产之光,开源界的扛把子
Qwen 系列 阿里巴巴 阿里的通义千问,同样开源,生态很全

当然还有 Gemini(Google)、Claude(Anthropic)等等,我们在第2章会展开讲。

六、一句话总结第1章

如果有人问你"LLM 是什么?",你就说:

LLM 就是在海量文本上训练出来的大型语言模型,参数多、数据多、本事大,能理解、能生成、能推理,一个模型干所有语言相关的活儿。

赞(0)
未经允许不得转载:171主机测评 » 第1章 LLM概述
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址