欢迎光临
我们一直在努力

大模型预训练到底是什么,一文通俗讲明白

文章目录

      • 前言
      • 1 先搞懂:预训练到底在干一件什么事
        • 1.1 打个最通俗的比方
        • 1.2 核心是“自己当自己的老师”
      • 2 三个阶段别搞混:预训练、微调、推理
        • 2.1 各自的活儿是什么
        • 2.2 一句话记明白
      • 3 主流的两种预训练路子
        • 3.1 自回归派:接龙专业户
        • 3.2 掩码语言模型:完形填空高手
      • 4 GPT具体是怎么练出来的?
      • 5 训练数据都从哪来?
      • 6 预训练到底有多烧钱?
        • 6.1 规模是什么概念
        • 6.2 成本有多夸张
        • 6.3 为啥大家都玩命堆规模?
      • 7 一整套工程流程,没那么简单
      • 8 预训练完的模型,到底学会了啥?
      • 9 普通人也能参与吗?
        • 9.1 走微调路线,站在巨人肩膀上
        • 9.2 做数据工程,这是被低估的风口
        • 9.3 用好模型,比训模型更重要

在这里插入图片描述
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程
http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

前言

天天用各种大模型聊天,有没有人好奇过——这玩意儿刚“出生”的时候,其实根本不会聊天?

别不信,咱们现在随手用的对话AI,全是后天一步步“改造”出来的。它最初的形态,就是个只会“接下一句”的文本续写机器。

而把它从一张白纸练成续写机器的核心过程,就是今天要聊的:预训练。

1 先搞懂:预训练到底在干一件什么事

说穿了特别简单,跟人学说话的逻辑一模一样。

1.1 打个最通俗的比方

把一个人关进全是书的图书馆,不给手机不让唠嗑,就让他没日没夜翻书。

翻的时候他会下意识顺着文字往下想,下一个词该是什么。翻个几年下来,语法、常识、逻辑,甚至写文章的本事,自然就都有了。

搁正常人待俩月就得疯,模型待几个月,直接成语言大师,还不用管饭。

大模型的预训练,干的就是这件事。

1.2 核心是“自己当自己的老师”

很多人以为训练模型得人工标数据,标到天昏地暗。

预训练根本不用。文本本身就是答案,模型自己给自己出题。

要么猜下一个词,要么填被遮住的词,猜对了就算学会了,猜错了就调整自己的参数。

这种自己教自己的方式,行话叫自监督学习。说白了就是自学成才,不用家教,省了一大笔补课费。

2 三个阶段别搞混:预训练、微调、推理

很多人聊大模型张嘴就说“训练”,其实这事儿完整分三步,分工完全不一样。

2.1 各自的活儿是什么

第一阶段,预训练。喂万亿级的文本,靠自监督学习,练出基座模型。

第二阶段,微调。拿整理好的指令数据集,监督学习,让模型学会听指令。

第三阶段,推理。就是咱们平时用的过程,输入问题,模型输出答案。

2.2 一句话记明白

预训练就是埋头苦读万卷书,打牢基础。

微调就是老师带着刷真题,学答题套路。

推理就是上考场答题,给用户输出结果。

跟咱们上学考试一个流程,区别是模型不用熬夜背知识点,也不会考前焦虑,更不会考完试就全忘光。

咱们平时用的各种聊天AI,全是走完了这三步的成品,不是天生就会唠嗑的。

3 主流的两种预训练路子

别看现在大模型五花八门,预训练的核心玩法,其实就两大流派。

3.1 自回归派:接龙专业户

代表就是GPT系列,核心玩法就是预测下一个词。

给它“今天天气”,它就猜下一个是“很”;给它“今天天气很”,它就猜下一个是“好”。

跟咱们小时候玩的成语接龙、故事接龙一模一样,一路往下接,接得越顺越厉害。

现在咱们常用的对话、生成类大模型,基本走的都是这条路线。

3.2 掩码语言模型:完形填空高手

代表是BERT系列,玩法是把句子里的词遮住,让模型猜被遮住的是什么。

比如“今天[MASK]很好”,让模型填中间的“天气”。

这就不是接龙了,是标准的完形填空。这种训练出来的模型,特别擅长理解文本意思,分类、抽信息这类活手到擒来,但不擅长写东西。

简单说,一个擅长写,一个擅长读,分工明明白白。

4 GPT具体是怎么练出来的?

听着万亿参数很唬人,原理其实朴素得很。

就拿一句“今天天气很好”举例。

先拆成一个个最小的文本单元,也就是token。

然后给模型看“今天”,让它猜下一个是“天气”;给它看“今天、天气”,让它猜下一个是“很”;再给它看“今天、天气、很”,猜下一个是“好”。

猜错了就算误差,然后反向调整参数,下次争取猜对。

就这么一遍一遍猜,一遍一遍改,万亿次重复下来,语言规律就刻进参数里了。

说穿了就是题海战术,跟你刷一万道题就会做同类题一个道理,人家模型刷题速度比你快一万倍,还不用喝奶茶提神。

5 训练数据都从哪来?

一句话:网上能找到的正经文字,几乎都能拿来当素材。

网页、书籍、学术论文、代码、维基百科、论坛帖子……只要是成文的文本,都能喂给模型。

但不是抓过来直接喂。原始数据脏得很,重复的、垃圾的、低质量的,还有带隐私信息的,全都不能要。

得先清洗:去重、过滤、脱敏、筛掉没用的内容。

别小看清洗这一步,很多时候比训练本身还费工夫。就像你买菜回家,择菜洗菜的时间,往往比炒菜还久,洗不干净吃了还拉肚子,数据洗不干净,模型学歪了更麻烦。

6 预训练到底有多烧钱?

这么说吧,这事儿基本是大厂专属游戏,小公司连上桌的资格都难有。

6.1 规模是什么概念

数据量,万亿token起步。啥概念?一本红楼梦也就几十万字,万亿token相当于几万套红楼梦摞起来。

参数规模,几十亿到上万亿不等。

GPU数量,几千到几万张A100、H100起步。一张卡就得几十万,光硬件就是一笔天文数字。

训练时间,少则几周,多则几个月。几千张卡连轴转,那电费比一个小区的居民用电还猛,供电局看了都得乐开花。

6.2 成本有多夸张

早年的GPT-3,大概用了355 GPU·年,换算成钱,大几百万美元打不住。

到GPT-4这个级别,直接是数万GPU·年,成本直接冲到上亿美元。

硬件、电费、人力加起来,百万美元是起步,顶级模型得按亿算。

说白了,预训练拼的不止是算法,更是钱和资源。普通团队想从头练个大模型,跟你想自己造个火箭上天难度差不多,想想就行了,别真试。

6.3 为啥大家都玩命堆规模?

因为行业里有个铁律,叫Scaling Law,缩放定律。

简单说就是:模型参数、数据量、计算量,三者按比例一起涨,模型性能就会稳定提升。

模型扩大10倍,数据也跟着扩10倍,计算量就得扩大概100倍,效果就会肉眼可见地变好。

就跟你充游戏似的,充得越多战力越高,而且明码标价,童叟无欺,不存在暗箱操作。这也是当年大厂敢砸钱堆大模型的底气所在。

7 一整套工程流程,没那么简单

别以为预训练就是写几行Python代码跑起来就行,这是个完整的系统工程。

第一步,收集数据,全网扒各种文本素材。

第二步,清洗数据,去重、过滤、脱敏,把脏东西全筛掉。

第三步,训练分词器,把文字拆成标准化的小单元。

第四步,分词处理,把所有文本都转成模型能看懂的token。

第五步,构建训练样本,整理成一组组能用来训练的素材。

第六步,分布式训练,数据并行、张量并行、流水线并行一起上,把大模型摊到几千张GPU上跑。

第七步,保存存档,隔段时间存个进度,防止程序崩了全白干。

第八步,评估验证,时不时检验一下模型学得到底行不行。

这里面最复杂的就是分布式训练,不然万亿参数的模型,单张卡根本装不下,跑一年都跑不完。

8 预训练完的模型,到底学会了啥?

预训练结束的模型,叫基座模型,本事已经很大了,但有个致命问题:不会好好聊天。

语言能力、多语言翻译、语法语义,它都门儿清。

世界知识、常识事实,它肚子里也装了一大堆。

写代码、做基础逻辑推理、数学计算,也都能来两下。

但你跟它说“你好”,它大概率不会回“你好呀”,而是给你一段百科式的介绍,跟个只会背书的书呆子似的,主打一个答非所问。

所以还得经过后面的指令微调和人类对齐,把它从“书呆子”改成“会唠嗑的聊天搭子”。

9 普通人也能参与吗?

看到这儿可能有人觉得,这都是大厂的事,跟咱们普通人没关系。

还真不是。想掺和大模型赛道,门槛没你想的那么高,至少有三条路能走。

9.1 走微调路线,站在巨人肩膀上

现在开源的基座模型一抓一大把,人家已经花大价钱做完预训练了,你直接拿来用就行。

准备个几千到几万条自己业务的问答数据,找几张3090或者A100,用现成的框架跑几天,就能整出一个懂你业务的专属模型。

相当于别人已经把大学读完了,你给它做个岗前培训,就能上岗干活了,性价比拉满,比自己从头培养划算多了。

9.2 做数据工程,这是被低估的风口

模型好不好,数据质量是关键。而清洗数据、做高质量语料、设计指令数据集,恰恰是普通人能发力的地方。

写爬虫、搭清洗管道、去重过滤、做隐私脱敏,再到设计提示词模板、标注数据、做质量评估,全是行业刚需。

以后AI训练师、数据工程师这类岗位,只会越来越吃香。

9.3 用好模型,比训模型更重要

对绝大多数人来说,最有价值的参与方式,根本不是训练模型,而是用模型。

写代码、做文案、处理表格、搭知识库、做自动化客服……能把大模型揉进自己的工作流里,实实在在提升效率,就已经赢过大多数人了。

你不用自己从零造跑车,学会开车、会改装、懂保养,照样能在赛道上跑在前面。毕竟大街上跑的车,没几辆是车主自己造的。

最后一句话收个尾。

预训练,就是让模型在海量文本里,靠预测下一个词或者做完形填空的方式自学,练出语言能力和知识储备,造出基座模型。再经过微调和人类对齐,才变成咱们天天用的聊天AI。

预训练是大厂的战场,但应用和微调,是每个人的机会。

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

赞(0)
未经允许不得转载:171主机测评 » 大模型预训练到底是什么,一文通俗讲明白
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址