翠花上周来找我,一脸郁闷。
他说最近用AI干活越来越憋屈——原来随便聊,现在每天几条免费额度,用完就得等明天,或者掏钱开会员。
"有没有办法绕过这个?"他问我。
我说有啊,本地部署。
他眼睛亮了。
“就是把自己电脑变成AI服务器,模型装在自己机器上,想怎么用怎么用,不用联网,不用担心额度,也不用担心数据隐私。”
翠花当场决定:搞。

然后我给他泼了冷水。
先搞懂一个问题:你的电脑跑得动吗
翠花说他的电脑是三年前买的,当时配的时候还算主流。
我问他知不知道CPU和GPU的区别。
他摇头。
其实大多数人都不清楚,但这件事决定了你能不能跑AI。
CPU是高材生,GPU是一群小学生
CPU就像一个高材生,逻辑强但只有一个脑子。GPU呢,就像一千个小学生,单个啥也不会,但架不住人多,同时做题一秒钟全部算完。
AI干的就是这种海量、简单的并行运算——高材生(CPU)太慢,一群小学生(GPU)才是正确打开方式。

算力到底是什么
说清楚了CPU和GPU,算力就好理解了。
算力就是单位时间内能处理多少运算。
手机里的CPU,一秒钟能算几亿次。听着多,但对AI来说不够。
电脑上RTX 4090显卡,算力大概是83 TFLOPS——每秒83万亿次浮点运算。
什么概念?
用CPU跑一个7B参数的开源模型,生成一个词可能要零点几秒,聊一段话等半天。
用4090,生成速度快10倍以上,基本感觉不到延迟。
这就是为什么AI一定要用GPU。CPU不是不能跑,是跑得太慢了,慢到没法用。
Token跟算力的关系
Token是什么,之前专门写过一篇,不再重复(没看过的可以翻一下《什么是Token?翠花说AI肯定认识汉字,我当场证明她错了》)。
这里只说一句话:每个Token的生成,都要把整个神经网络的参数跑一遍,这是纯算力消耗。
Token越多,烧的算力越多。
算力和Token的关系
说到这里,关系其实就清楚了。
算力大小,决定了两件事:生成每个Token的速度,以及能同时处理多少个Token。
按Token收费的逻辑也在这里——不是厂商想割韭菜,是每个Token真的要烧算力、烧电、烧显卡。

回到翠花的问题:你的电脑能部署什么级别的模型
翠花听完,沉默了一会儿。
“那我这电脑,能跑什么?”
我说实话——普通个人电脑能跑的模型,级别就这么几个,而且门槛不低。

翠花的电脑,显卡是集成显卡,连独立显卡都没有。
我告诉他:用CPU跑7B模型,不是不行,就是你会觉得自己在跟树懒聊天。
距离正常使用还有多远
这才是真正的问题。
现在的开源模型,7B这个级别,性能大概相当于GPT-3.5的水平——能用,但没那么聪明。
想要更好的效果,就得上更大的模型,13B、34B、70B……但模型越大,需要的算力越高,显存需求也越高。
普通人想在自己电脑上跑一个"好用"的大模型,现在的门槛还是挺高的。
不是完全不可能,是需要花钱升级硬件。
一张能跑大模型的显卡,便宜的几千,贵的上万。
这就是为什么大部分人还是选择用云服务——不是不想本地部署,是成本太高了。
下期预告
翠花最后问了我一个问题:“那这些模型的7B、13B、70B,到底是什么意思?为什么数字越大越厉害?”
这个问题问到了点子上。
这些数字,就是大模型的参数数量。
参数到底是什么,为什么越多越好,多少个参数才算"够用"——下期讲。
关注小虾,一起成长,一起进化


